質問をすることでしか得られない、回答やアドバイスがある。

15分調べてもわからないことは、質問しよう!

新規登録して質問してみよう
ただいま回答率
85.48%
for

for文は、様々なプログラミング言語で使われている制御構造です。for文に定義している条件から外れるまで、for文内の命令文を繰り返し実行します。

if

if文とは様々なプログラミング言語で使用される制御構文の一種であり、条件によって処理の流れを制御します。

Python

Pythonは、コードの読みやすさが特徴的なプログラミング言語の1つです。 強い型付け、動的型付けに対応しており、後方互換性がないバージョン2系とバージョン3系が使用されています。 商用製品の開発にも無料で使用でき、OSだけでなく仮想環境にも対応。Unicodeによる文字列操作をサポートしているため、日本語処理も標準で可能です。

pandas

Pandasは、PythonでRにおけるデータフレームに似た型を持たせることができるライブラリです。 行列計算の負担が大幅に軽減されるため、Rで行っていた集計作業をPythonでも比較的簡単に行えます。 データ構造を変更したりデータ分析したりするときにも便利です。

Q&A

解決済

1回答

13395閲覧

Pandasで、文字列が混在したデータフレームを数値化する方法を教えて頂けませんか

YOSHITAKEH

総合スコア21

for

for文は、様々なプログラミング言語で使われている制御構造です。for文に定義している条件から外れるまで、for文内の命令文を繰り返し実行します。

if

if文とは様々なプログラミング言語で使用される制御構文の一種であり、条件によって処理の流れを制御します。

Python

Pythonは、コードの読みやすさが特徴的なプログラミング言語の1つです。 強い型付け、動的型付けに対応しており、後方互換性がないバージョン2系とバージョン3系が使用されています。 商用製品の開発にも無料で使用でき、OSだけでなく仮想環境にも対応。Unicodeによる文字列操作をサポートしているため、日本語処理も標準で可能です。

pandas

Pandasは、PythonでRにおけるデータフレームに似た型を持たせることができるライブラリです。 行列計算の負担が大幅に軽減されるため、Rで行っていた集計作業をPythonでも比較的簡単に行えます。 データ構造を変更したりデータ分析したりするときにも便利です。

0グッド

1クリップ

投稿2018/11/24 18:16

編集2018/11/25 01:13

Pandasのデータテーブルに、文字列が混ざっています。数値(整数:int)にする方法がうまくいきません。アドバイスを頂けますでしょうか。

やりたいこと

以下、現在のdataflame(以下、df)に対して、

dateitemsales
2018-1-1トマト983220
2018-1-1りんご233320
2018-1-2みかん29.1万円
2018-1-3トマト1983220
2018-1-4りんご1233320
2018-1-5ぶどう19.1万円

sales列の中から、万円の文字を削除し、さらに1000倍して桁数をあわせ、全て整数(int型)に統一したいです。

以下、希望のデータフレームのようにしたいです。

dateitemsales
2018-1-1トマト983220
2018-1-1りんご233320
2018-1-2みかん291000
2018-1-3トマト1983220
2018-1-4りんご1233320
2018-1-5ぶどう191000

試したこと

まず、考えたのは、

  • 万円を replace関数で削除する
  • 1000倍する(float()と、*1000)
  • 数値(整数)にする(int())

そして、これをfor文で繰り返す。

ということです。私が考えたのは、以下のようなコードです。

python

1for i in range(1,len(df['sales'])): 2 if "万" not in df.loc[i,'sales']: 3 df.loc[i,'sales'] = int(df.loc[i,'sales']) 4 else: 5 df.loc[i,'sales'] = int(float(df.loc[i,'sales'].replace('万',''))*1000)

教えて頂きたいこと

1.FOR文、IF文の書き方の誤りについて

上記のコードのうち、最下部の

python

1int(float(df.loc[i,'sales'].replace('万',''))*1000)

をfor文、及びif文を使わずに、1つのセルだけ置換、1000倍、型変換をすると、求める数値が算出できます。しかし、for文やif文を使うとエラーがでてしまいます。for文、if文の誤りをご指摘いただけないでしょうか。

1.FOR文、IF文を使わないスマートな方法を教えていただけませんでしょうか。

いろいろ調べていると、map関数、Lambda式など、もう少しスマートな方法があるようなことを知りました。わたしのやりたいことに照らし合わせると、FOR文やIF文は、相応しくないのでしょうか?アドバイスいただけると幸いです。

環境

Macbook pro
Anaconda
Python 3.6
Jupyter notebook
panas

お忙しいとは思いますが、よろしくお願いいたします。
情報に不足がありましたら、ご指摘くださいませ。

気になる質問をクリップする

クリップした質問は、後からいつでもMYページで確認できます。

またクリップした質問に回答があった際、通知やメールを受け取ることができます。

バッドをするには、ログインかつ

こちらの条件を満たす必要があります。

guest

回答1

0

ベストアンサー

行データ内のsales列を整数の円に換算する関数toYenを用意し
.map(toYen,axis=1)で行毎に適用するとよいです。

Python

1import pandas as pd 2df = pd.DataFrame({'date':['2018-1-1','2018-1-1'],'item':['tomato','orange'],'sales':['983220','29.1万円']}) 3print(df) 4""" 5 date item sales 60 2018-1-1 tomato 983220 71 2018-1-1 orange 29.1万円 8""" 9 10# salesを整数の円に換算 11def toYen(row): 12 sales = row['sales'] 13 pos = sales.find('万') 14 if pos < 0: 15 sales = int(sales) 16 else: 17 sales = int(float(sales[:pos]) * 10000) # 「万」の手前までの数値を抽出し1万倍する 18 19 row['sales'] = sales 20 return row 21 22df.apply(toYen,axis=1) # 行毎に処理 23print(df) 24""" 25 date item sales 260 2018-1-1 tomato 983220 271 2018-1-1 orange 291000 28"""

投稿2018/11/25 02:30

can110

総合スコア38266

バッドをするには、ログインかつ

こちらの条件を満たす必要があります。

YOSHITAKEH

2018/11/25 03:24

can110様 ご回答誠にありがとうございました。おかげさまで解決できました。
guest

あなたの回答

tips

太字

斜体

打ち消し線

見出し

引用テキストの挿入

コードの挿入

リンクの挿入

リストの挿入

番号リストの挿入

表の挿入

水平線の挿入

プレビュー

15分調べてもわからないことは
teratailで質問しよう!

ただいまの回答率
85.48%

質問をまとめることで
思考を整理して素早く解決

テンプレート機能で
簡単に質問をまとめる

質問する

関連した質問