外れ値(Outlier)とは、データセットの大部分のデータポイントから大きく外れた異常な値を持つデータポイントです。計測エラー、データ入力ミス、または真に稀な事象を反映している場合があり、適切な検出と処理が機械学習の前処理において重要です。
外れ値の検出方法
IQR法(四分位範囲の1.5倍を超える値)、Zスコア法(平均から3標準偏差以上離れた値)、Isolation Forest、LOF(Local Outlier Factor)、箱ひげ図による視覚的検出などがあります。
| ひとことで言うと | 他のデータから大きく離れた、極端な値のこと。 |
|---|---|
| どう対応するか | 入力ミスなら修正か除外、本物の異常値なら残して別途分析する。 |
| 注意点 | 機械的に削除すると、本当に見つけたかった事象(不正・故障)を消してしまう。 |
外れ値の処理
除外、置換(上限値・下限値でクリッピング)、対数変換による影響の軽減、ロバストな手法(中央値や四分位数を使用)の利用など、状況に応じた処理方法を選択します。
1分布を確認箱ひげ図やヒストグラム
▶
2候補を検出四分位範囲やz値で
▶
3原因を確認入力ミスか実際の値か
▶
4対応を決める修正・除外・そのまま
外れ値を残すべき場合
異常検知タスクでは外れ値こそが分析対象です。また、真に稀な事象を反映している外れ値は、安易に除去すべきではありません。ドメイン知識に基づいた判断が重要です。