ガードレール(安全性)

Guardrails (Safety)

ガードレールとは

ガードレール(Guardrails)とは、AIシステムが安全かつ適切に動作するよう制約を設ける仕組みの総称です。道路のガードレールが車両の逸脱を防ぐように、AIのガードレールはモデルの出力が許容範囲を超えないよう制御します。入力の検証から出力のフィルタリングまで、多層的な安全対策を含みます。

表:ガードレール(安全性)の要点まとめ
ひとことで言うとAIが安全な範囲で動くように設ける、入力・出力・動作の制限。
どこに置くか入力検査、システムプロンプト、実行権限、出力検査、ログ監視。
注意点プロンプトでの指示だけでは破られる。システム側の制御が本体。

ガードレールの種類

ガードレールは実装レベルに応じて分類されます。モデルレベルのガードレールはRLHFやConstitutional AIによる安全性調整を指し、アプリケーションレベルのガードレールは入出力フィルタやキーワードブロックリスト、トピック制限などを含みます。システムレベルのガードレールはレート制限やアクセス制御、ログ記録などを指します。

図:ガードレールの多層構造
1入力を検査危険な指示を弾く
▶
2役割を限定できることを絞る
▶
3権限を制限システム側で強制
▶
4出力を検査有害・機密を除去
▶
5ログを監視異常を後から検知

実装のアプローチ

実務的なガードレールの実装には、ルールベース(正規表現やキーワードマッチング)、分類器ベース(有害性を判定するAIモデル)、LLMベース(別のLLMに安全性を判定させる)などのアプローチがあります。NeMo Guardrails(NVIDIA)やGuardrails AI、LlamaGuardなど、ガードレール構築のためのフレームワークやツールも提供されています。

ガードレールの課題

ガードレールの設計には、安全性と有用性のバランスが重要です。過度に厳格なガードレールはユーザー体験を損ない、緩すぎるガードレールは安全性のリスクを残します。また、ジェイルブレイクやプロンプトインジェクションによるガードレールの回避が常に試みられるため、継続的な改善と更新が必要です。多層防御の考え方に基づく設計が推奨されます。