その生成分類モデルを別データに使用する際、使用データにもオーバーサンプリングは実施すべきなのでしょうか?
「別データ・使用データ」というのはつまり性能評価に使うテストデータのことを考えているのでしょうか? だとすればクラス間のサンプル数不均衡で評価指標が変わるという問題に帰着します。
テストデータに擬似的に生成したデータが混ざると、その評価方法が妥当なのかどうかという余計な懸念を産んでしまいます。性能が現実より高く見積もられてしまうのでは、といった懸念ですね。
シンプルに説明が面倒くさくなるので、私ならやらないと思います。
評価指標を使う前には、以下のような手続きを踏みます。データ不均衡を気にする前に、まずはこれがちゃんとできているかを確認してください。
-
まず評価指標を適切に選ぶ
どれか目的にかなったものを選ばないといけません。適合率、再現率、F1のどれにフォーカスするのか。解約予備軍クラスかどうかの二値分類問題として評価指標を算出するのか。多クラスなのか(マクロ平均、マイクロ平均)。など、考えるべきことは多いでしょう。今回のような場合、無難なのは二値分類問題とみなしたときのF1でしょうか。
-
その評価指標を使う
同等のデータで、同等の方法で計算した評価指標同士は比較できます。逆に言うと、データを変えたり計算方法を変えたりした数字の優劣は気にしても意味がありません。要するに、モデル選択以外では評価指標はあまり役に立たないと割り切って、腹をくくることです。
で、どうやったにせよ、ほとんどの方法ではオーバーサンプリングするかどうかで結果は変わります。
退会済みユーザー
2020/02/04 00:27
2020/02/04 00:44
2020/02/04 00:48 編集
退会済みユーザー
2020/02/04 01:40