異常検知(統計)

Anomaly Detection

異常検知(統計)とは

異常検知(Anomaly Detection)とは、データの中から通常のパターンから逸脱した異常なデータポイントやパターンを自動的に検出する手法です。統計的異常検知では、データの統計的性質に基づいて「正常」の範囲を定義し、その範囲外のデータを異常と判定します。

表:異常検知(統計)の要点まとめ
ひとことで言うと通常のパターンから大きく外れたデータを、統計的に見つけ出す手法。
どこで使う設備の故障予兆、不正取引の検知、システム監視、品質異常の発見。
注意点異常のサンプルはほとんど集まらない。正常だけで学ぶ手法が中心になる。

統計的手法による異常検知

基本的な手法として、Zスコア法(データが平均から何標準偏差離れているかで判定)、IQR法(四分位範囲の1.5倍を超える値を外れ値とする)、グラブス検定(最大の外れ値を統計的に検定)などがあります。これらは単変量の異常検知に適しています。

図:統計的な異常検知の流れ
1正常データを集める通常運転時の記録
▶
2正常範囲を定義平均±3σなど
▶
3新データと比較範囲内に収まるか
▶
4異常度を算出どれだけ外れているか
▶
5しきい値で通知超えたらアラート

多変量の異常検知

複数の変数を同時に考慮する場合は、マハラノビス距離(多変量空間での距離指標)、ホテリングのT二乗統計量、Local Outlier Factor(LOF)、Isolation Forestなどが使用されます。高次元データでは、次元削減と組み合わせた手法が効果的です。

異常検知の応用

不正取引の検出、製造業における品質異常の検知、ITシステムの障害検出、医療における異常バイタルの検知、ネットワーク侵入検知など、多岐にわたる分野で活用されています。時系列データの異常検知では、季節性やトレンドを考慮したモデリングが必要です。