エージェント評価

Agent Evaluation

エージェント評価とは

エージェント評価(Agent Evaluation)とは、AIエージェントの性能、信頼性、安全性を体系的に測定・評価するプロセスのことです。エージェントが実際のタスクをどの程度正確かつ効率的に遂行できるかを客観的に把握し、改善に繋げるために不可欠です。

表:エージェント評価の要点まとめ
ひとことで言うとエージェントが本当に役に立つかを、タスク成功率などで測ること。
何を測るかタスク完了率、所要時間、コスト、人の介入回数、失敗の種類。
注意点1回動いただけでは判断できない。同じ課題を何度も試して成功率で見る。

評価の難しさ

エージェントの評価は、従来のAIモデル評価よりも複雑です。エージェントは複数のステップにわたって行動し、外部ツールと連携し、非決定的な結果を生成するため、単純な正解率だけでは十分に評価できません。中間ステップの品質、ツール選択の適切さ、エラー回復能力なども評価対象になります。

図:エージェント評価の進め方
1評価課題を用意実務に近いタスク集
▶
2複数回実行ばらつきを測る
▶
3成功率を算出何割やり遂げたか
▶
4コストも記録時間と料金
▶
5失敗を分類改善点を特定

評価指標

エージェントの評価指標には、タスク完了率(タスクを最終的に完了できたか)、正確性(結果の品質)、効率性(ステップ数、API呼び出し回数、実行時間)、コスト(トークン使用量、API料金)、安全性(有害な行動の回避)、ユーザー満足度などがあります。

評価手法とツール

ベンチマーク(SWE-bench、WebArena、GAIA、AgentBenchなど)による定量評価、人間の専門家による定性評価、A/Bテスト、シミュレーション環境でのテスト、LLMによる自動評価(LLM-as-a-Judge)など、複数の評価手法を組み合わせることが推奨されています。