異常検知(統計)とは
異常検知(Anomaly Detection)とは、データの中から通常のパターンから逸脱した異常なデータポイントやパターンを自動的に検出する手法です。統計的異常検知では、データの統計的性質に基づいて「正常」の範囲を定義し、その範囲外のデータを異常と判定します。
| ひとことで言うと | 通常のパターンから大きく外れたデータを、統計的に見つけ出す手法。 |
|---|---|
| どこで使う | 設備の故障予兆、不正取引の検知、システム監視、品質異常の発見。 |
| 注意点 | 異常のサンプルはほとんど集まらない。正常だけで学ぶ手法が中心になる。 |
統計的手法による異常検知
基本的な手法として、Zスコア法(データが平均から何標準偏差離れているかで判定)、IQR法(四分位範囲の1.5倍を超える値を外れ値とする)、グラブス検定(最大の外れ値を統計的に検定)などがあります。これらは単変量の異常検知に適しています。
1正常データを集める通常運転時の記録
▶
2正常範囲を定義平均±3σなど
▶
3新データと比較範囲内に収まるか
▶
4異常度を算出どれだけ外れているか
▶
5しきい値で通知超えたらアラート
多変量の異常検知
複数の変数を同時に考慮する場合は、マハラノビス距離(多変量空間での距離指標)、ホテリングのT二乗統計量、Local Outlier Factor(LOF)、Isolation Forestなどが使用されます。高次元データでは、次元削減と組み合わせた手法が効果的です。
異常検知の応用
不正取引の検出、製造業における品質異常の検知、ITシステムの障害検出、医療における異常バイタルの検知、ネットワーク侵入検知など、多岐にわたる分野で活用されています。時系列データの異常検知では、季節性やトレンドを考慮したモデリングが必要です。