オーバーサンプリング

Oversampling

オーバーサンプリング(Oversampling)とは、不均衡データにおいて少数派クラスのサンプル数を増やしてクラス間のバランスを改善する手法です。最もシンプルな方法はランダムオーバーサンプリング(少数派のサンプルをランダムに複製)です。

ランダムオーバーサンプリング

既存の少数派サンプルをランダムに選んで複製します。実装が容易ですが、同じサンプルの複製により過学習のリスクが高まるという欠点があります。

表:オーバーサンプリングの要点まとめ
ひとことで言うと少ないほうのクラスのデータを増やして、件数の偏りを減らす手法。
主な方法単純な複製、SMOTE(似たデータを人工的に合成)。
注意点必ず訓練データだけに行う。検証・テストに使うと性能を過大評価する。

SMOTEなどの合成手法

SMOTE(Synthetic Minority Over-sampling Technique)は少数派サンプル間を補間して新しい合成サンプルを生成します。単純な複製よりも多様なサンプルを生成でき、過学習のリスクを軽減します。

図:オーバーサンプリングの手順
1データを分割先に訓練とテストを分ける
▶
2訓練の少数派を増やす複製または合成
▶
3件数が均衡50:50に近づく
▶
4学習する少数派も学べる
▶
5元の比率で評価テストは手を加えない

注意点

オーバーサンプリングは必ず訓練データにのみ適用し、テストデータには適用しません。また、交差検証の分割後に行う必要があります(分割前に行うとデータリークが発生)。