膨大な列からなるCSVファイルを効率的に読み込みたい。

動作環境　R studio

Rでcsvファイル（factor,integer,dateが混在した100列以上からなる)を型を指定して、効率よく読みたいです。型を指定するため、read.csv(...,colClasses=c(...))を活用しようとしています。しかし、integerを指定するとエラーが発生しまうのでうが原因がわかりません。

scan(file = file, what = what, sep = sep, quote = quote, dec = dec, でエラー:
scan() 関数は 'an integer' を期待したのに、得られたのは '"1"' でした

サンプルデータの作成

x<-c(sample(1:100,10))/100
y<-c(sample(letters,10))
z<-c(sample(1000:1100,10))/10
x2<-c(sample(1:100,10))
y2<-c(sample(c("OK","NG"),10,replace=T))
dt<-data.frame(lot=x,name=y,item=z,item2=x2,result=y2)
Names<names(dt)
write.csv(dt,file="sample.csv")
rm(dt)

dt.head<-read.csv("sample.csv",nrow=3)
classes<-as.vector(sapply(df.head,class))
Name<-names(dt)

型を指定するとscan()エラが発生する。

read.csv("sample.csv",colClasses=classes,fileEncoding="UTF-8",fill=TRUE,col.names=Name)

すべて"character"として読み込む

read.csv("sample.csv",colClasses="character",fileEncoding="UTF-8",fill=TRUE,col.names=Name)->df2
sapply(df2,class)

どうやらはじめのintegerでエラが発生している

print(classes)

　エラー箇所を回避する。

read.csv("sample.csv",colClasses=c("character","numeric","factor","numeric","integer","factor"),fileEncoding="UTF-8",fill=TRUE,col.names=Name)->df3
sapply(df3,class)

#参考文献
#http://www.asnm4.com/2014/05/factorと数値型の変換/

行動規範の内容に同意します

回答1件

ベストアンサー

scan() 関数は 'an integer' を期待したのに、得られたのは '"1"' でした

直接的な原因はここにあります。1でなければならないところ"1"になっていたので整数値として扱えないとして文句を言っているわけです。Rの関数はいろいろと融通が利きません。

で、なぜそんなことが起こるのかですが、テストデータの作成過程において実行されているwrite.csv(dt,file="sample.csv")が、勝手に行番号を各行の先頭に付加するからです。Rの関数はいろいろと要らんことをしてきます。しかも、行「番号」なら普通に数字だけ出力すればいいものを、わざわざ引用符をつけやがります。Rの関数は頭が悪いですね。
邪魔なので、オプションをつけてこれを止めさせます。

 write.csv(dt,file="sample.csv", row.names=NULL)

これでエラーは出なくなるでしょう。

なお、この問題はRからでてsample.csvを出力させてみればすぐに気が付けたと思いますよ。

投稿2020/06/13 07:36

KojiDoi

総合スコア13671

あなたの回答

tips

プレビュー

行動規範の内容に同意します

質問の解決につながる回答をしましょう。サンプルコードなど、より具体的な説明があると質問者の理解の助けになります。また、読む側のことを考えた、分かりやすい文章を心がけましょう。

15分調べてもわからないことは
teratailで質問しよう！

ただいまの回答率
85.48%

質問をまとめることで
思考を整理して素早く解決

テンプレート機能で
簡単に質問をまとめる

質問する

質問をすることでしか得られない、回答やアドバイスがある。

15分調べてもわからないことは、質問しよう！

膨大な列からなるCSVファイルを型を指定して読み込みたい read.csv(colClasses="")

膨大な列からなるCSVファイルを効率的に読み込みたい。

動作環境　R studio

サンプルデータの作成

型を指定するとscan()エラが発生する。

すべて"character"として読み込む

どうやらはじめのintegerでエラが発生している

エラー箇所を回避する。

関連した質問

質問をすることでしか得られない、回答やアドバイスがある。

15分調べてもわからないことは、質問しよう！

膨大な列からなるCSVファイルを効率的に読み込みたい。

動作環境 R studio

サンプルデータの作成

型を指定するとscan()エラが発生する。

すべて"character"として読み込む

どうやらはじめのintegerでエラが発生している

エラー箇所を回避する。

関連した質問

動作環境　R studio

　エラー箇所を回避する。