データポイズニング

Data Poisoning

データポイズニングとは

データポイズニングとは、機械学習モデルの学習データに悪意のあるデータを混入させ、モデルの性能を低下させたり、意図的な誤動作を引き起こしたりする攻撃手法のことです。AIセキュリティにおける深刻な脅威の一つであり、データガバナンスの観点からは、学習データの完全性(Integrity)を確保する重要性を示す概念です。

表:データポイズニングの要点まとめ
ひとことで言うと学習データに悪意あるデータを混ぜて、モデルの挙動を狂わせる攻撃。
ガバナンス上の対策データの出所管理、取り込み時の検証、変更履歴の記録。
注意点外部データやユーザー投稿を学習に使う場合、特に注意が必要。

攻撃の種類

データポイズニングには大きく2つの種類があります。可用性攻撃(Availability Attack)は、モデル全体の精度を低下させることを目的とし、ノイズや誤ったラベルのデータを大量に混入させます。バックドア攻撃(Backdoor Attack)は、特定のトリガー(パターン)が入力に含まれる場合にのみ誤った予測をさせることを目的とし、通常のテストデータでは検出が困難です。例えば、画像認識モデルに特定のパッチが含まれる画像を誤分類させるよう学習させます。

図:ポイズニングへのガバナンス対策
1出所を限定信頼できる経路のみ
▶
2取り込み時に検証統計的な異常を検知
▶
3変更履歴を記録誰がいつ追加したか
▶
4学習後に評価性能の急変を確認
▶
5版を戻せる問題時に復元する

防御策とデータガバナンス

データポイズニングへの防御策として、データの出所と品質の検証、異常検出アルゴリズムによるポイズニングデータの検出、ロバストな学習アルゴリズムの使用(外れ値に頑健な損失関数等)、データのサニタイズ(クリーニング)などがあります。ガバナンスの観点では、データサプライチェーンの管理、データの来歴追跡(リネージ)、定期的なモデルの挙動監視、インシデント対応プロセスの整備が重要です。信頼できないソースからのデータの利用には特に注意が必要です。