質問をすることでしか得られない、回答やアドバイスがある。

15分調べてもわからないことは、質問しよう!

新規登録して質問してみよう
ただいま回答率
85.35%
SQL

SQL(Structured Query Language)は、リレーショナルデータベース管理システム (RDBMS)のデータベース言語です。大きく分けて、データ定義言語(DDL)、データ操作言語(DML)、データ制御言語(DCL)の3つで構成されており、プログラム上でSQL文を生成して、RDBMSに命令を出し、RDBに必要なデータを格納できます。また、格納したデータを引き出すことも可能です。

pandas

Pandasは、PythonでRにおけるデータフレームに似た型を持たせることができるライブラリです。 行列計算の負担が大幅に軽減されるため、Rで行っていた集計作業をPythonでも比較的簡単に行えます。 データ構造を変更したりデータ分析したりするときにも便利です。

Spark

Spark(Apache Spark)とは、膨大なデータを迅速、柔軟に分散並行処理を行うフレームワークです。分析ツールであるApache Hadoopと比較し、最大で100倍の速度でデータ処理ができるとされています。

Q&A

解決済

1回答

1060閲覧

groupbyによる組み合わせカラム作成

sasakin

総合スコア15

SQL

SQL(Structured Query Language)は、リレーショナルデータベース管理システム (RDBMS)のデータベース言語です。大きく分けて、データ定義言語(DDL)、データ操作言語(DML)、データ制御言語(DCL)の3つで構成されており、プログラム上でSQL文を生成して、RDBMSに命令を出し、RDBに必要なデータを格納できます。また、格納したデータを引き出すことも可能です。

pandas

Pandasは、PythonでRにおけるデータフレームに似た型を持たせることができるライブラリです。 行列計算の負担が大幅に軽減されるため、Rで行っていた集計作業をPythonでも比較的簡単に行えます。 データ構造を変更したりデータ分析したりするときにも便利です。

Spark

Spark(Apache Spark)とは、膨大なデータを迅速、柔軟に分散並行処理を行うフレームワークです。分析ツールであるApache Hadoopと比較し、最大で100倍の速度でデータ処理ができるとされています。

0グッド

0クリップ

投稿2021/04/01 11:45

助けてください;;
pandas(sql)のgroupby集計がわかりません。

各実験ごと(experiment)に,contorolとtarget(group)ごとにどれくらい対象がいるか集計したいです。
data.groupby('experiment','group').count()とすると

+-------------+----------+-----+ |experiment |group |count| +-------------+----------+-----+ |experiment1 |control |100 | |experiment1 |target |247 | |experiment2 |control |100 | |experiment2 |target |220 | |experiment3 |control |100 | |experiment3 |target |293 | +-------------+----------+-----+

という風になってしまいます。
理想としては

+-------------+-------------+------------+ |experiment |count_control|count_target| +-------------+-------------+------------+ |experiment1 |100 |143 | |experiment2 |130 |140 | |experiment3 |150 |102 | +-------------+-------------+------------+

のように集計したいです。どのようにしたらいいですか?

気になる質問をクリップする

クリップした質問は、後からいつでもMYページで確認できます。

またクリップした質問に回答があった際、通知やメールを受け取ることができます。

バッドをするには、ログインかつ

こちらの条件を満たす必要があります。

yambejp

2021/04/02 02:42

なぜ元テーブル100,247,100,220,100,293のデータが 処理後100,143,130,140,150,102になるのかロジックを說明してほしいです
guest

回答1

0

ベストアンサー

元のデータフレームが分からないので適当に推測すると、以下で出来そうな気がします。

python

1pd.get_dummies(data[['experiment', 'group']], columns=['group'], prefix='count').groupby(['experiment']).sum().reset_index()

投稿2021/04/01 12:29

ppaul

総合スコア24670

バッドをするには、ログインかつ

こちらの条件を満たす必要があります。

あなたの回答

tips

太字

斜体

打ち消し線

見出し

引用テキストの挿入

コードの挿入

リンクの挿入

リストの挿入

番号リストの挿入

表の挿入

水平線の挿入

プレビュー

15分調べてもわからないことは
teratailで質問しよう!

ただいまの回答率
85.35%

質問をまとめることで
思考を整理して素早く解決

テンプレート機能で
簡単に質問をまとめる

質問する

関連した質問