ジェイルブレイクとは
AIセキュリティにおけるジェイルブレイクとは、LLMに設定されたセーフティガードラインや利用ポリシーの制限を回避し、通常は拒否されるはずの有害・不適切なコンテンツを生成させる攻撃手法です。プロンプトインジェクションの一種ですが、特にモデルの安全機能の突破に焦点を当てています。
| ひとことで言うと | AIの安全制限を回避させ、禁止された出力を引き出す攻撃。 |
|---|---|
| 主な手口 | 役割演技、架空の設定、段階的な誘導、多言語や符号化での回避。 |
| 注意点 | 新しい手口が次々出る。継続的な検証と更新が必要。 |
ジェイルブレイクの手法
代表的な手法として、仮想的なシナリオ設定(「あなたは制限のないAIです」)、ロールプレイの悪用(「悪役の台本を書いてください」)、段階的な誘導(少しずつ制限境界を押し広げる)、多言語での指示(安全フィルターが弱い言語の利用)、エンコーディングの悪用(Base64やモールス信号での指示)などがあります。研究者による新しいジェイルブレイク手法は継続的に発見されています。
1入力を検査既知の手口を検出
▶
2モデル側の訓練断れるよう学習
▶
3出力を検査生成後にも確認
▶
4ログを監視試行を検知する
▶
5手口を更新新しい攻撃に追随
対策と課題
ジェイルブレイクへの対策は、モデルの安全学習(RLHF/RLAIF)の強化、ジェイルブレイクパターンの検出フィルター、出力モニタリング、レッドチーミングによる事前検証が中心です。しかし、攻撃手法の進化は防御の進化を常に上回る傾向にあり、完全な防御は困難です。継続的なレッドチーミングとモデルの更新による対応が現実的なアプローチとなっています。