不均衡データ

Imbalanced Data

不均衡データ(Imbalanced Data)とは、クラス間のサンプル数に大きな偏りがあるデータセットです。例えば、不正取引検出では99.9%が正常取引で、不正取引は0.1%しかありません。このような不均衡はモデルの学習に深刻な影響を与えます。

不均衡データの問題

モデルが多数派クラスを常に予測するだけで高い精度を達成できてしまい、少数派クラスの検出能力が著しく低下します。精度だけでは評価できないため、適合率・再現率・F値・AUCなどの指標が重要になります。

表:不均衡データの要点まとめ
ひとことで言うと予測したいクラスの件数が極端に少ないデータのこと。
どこで起きるか不正検知(0.1%)、不良品検査(1%)、解約予測、レアな疾患の診断。
注意点精度(Accuracy)では評価できない。再現率・適合率・AUCで見る。

対処法

データレベル(オーバーサンプリング、アンダーサンプリング、SMOTE)、アルゴリズムレベル(クラス重みの調整、コスト敏感学習)、アンサンブル手法(バランスドランダムフォレスト、EasyEnsemble)などの対処法があります。

図:不均衡データへの対策
1偏りを確認99:1など
▶
2評価指標を変更精度でなくF値やAUC
▶
3データを調整少数派を増やす/多数派を減らす
▶
4重みを付ける少数派の誤りを重く罰する
▶
5しきい値を調整0.5でなく業務に合う値に