ペネトレーションテスト(AIセキュリティ)

AI Penetration Testing

ペネトレーションテスト(AIセキュリティ)とは

AIセキュリティにおけるペネトレーションテストとは、実際の攻撃者の手法を模倣してAIシステムの脆弱性を発見する能動的なセキュリティテスト手法です。レッドチーミングの一形態として、AIシステム特有の攻撃ベクトルを重点的に検証します。

表:ペネトレーションテスト(AIセキュリティ)の要点まとめ
ひとことで言うと実際の攻撃者の手口をまねて、AIシステムに侵入を試みる検証。
何を試すかAPI経由の侵入、権限の越境、プロンプトインジェクション、モデルの抜き取り。
注意点必ず書面で許可を得てから実施する。本番環境では影響範囲に注意。

テストの範囲

AIペネトレーションテストは、LLMに対するプロンプトインジェクション、ジェイルブレイク、プロンプトリークの試行、画像・音声モデルに対する敵対的サンプルの生成と投入、モデル抽出攻撃の実証、プライバシー攻撃(メンバーシップ推定、モデル反転)の試行、APIの認証・認可の脆弱性の検証、サプライチェーンの弱点の調査など、AI特有の攻撃シナリオを網羅します。

図:AIペネトレーションテストの手順
1範囲と許可を確認何をどこまで行うか
▶
2偵察攻撃面を調査する
▶
3侵入を試行実際の手口で攻撃
▶
4影響を評価どこまで到達できたか
▶
5報告と修正対策後に再テスト

実施方法

AIペネトレーションテストは、ブラックボックス(外部からの攻撃者を模倣)、グレーボックス(部分的な内部情報を持つ攻撃者を想定)、ホワイトボックス(内部の詳細な知識を持つ攻撃者を想定)の各レベルで実施されます。自動化ツール(Garak、Counterfit、ART等)と手動テストを組み合わせ、定期的に実施することが推奨されます。テスト結果は脆弱性の深刻度で分類し、優先度に応じた改善を行います。