HellaSwagとは
HellaSwag とは、テキストの文脈理解と常識的推論能力を測定するベンチマークです。2019年にZellersらにより提案され、日常的な状況の記述に対して最も自然な続きを4つの選択肢から選ぶ形式の問題で構成されています。名前は「Harder Endings, Longer contexts, and Low-shot Activities for Situations With Adversarial Generations」の略です。
| ひとことで言うと | 文章の続きとして自然なものを選ばせ、常識的な推論力を測るテスト。 |
|---|---|
| 何が難しいか | 人間には簡単でも、AIには常識が必要で難しい問題が集められている。 |
| 注意点 | 4択形式のため、実際の文章生成能力とは異なる側面を測っている。 |
HellaSwagの特徴
HellaSwagの問題は、人間には容易でもAIにとっては難しいように設計されています。不正解の選択肢は言語モデルによって生成され、表面的には自然に見えるが文脈的に不適切な文が含まれています。このAdversarial Filtering手法により、単純な統計的パターンでは解けない問題が作られています。
1状況の文を提示「彼は皿を洗い始めた」
▶
24つの続きを提示1つだけ自然
▶
3常識で判断物理的・社会的に妥当か
▶
4正答率を測定常識推論力の指標
評価対象
HellaSwagは主に日常的な活動の理解を測定します。料理のレシピ、スポーツの動作、日常生活の場面などが題材として使われており、物理的な常識や社会的な常識に基づく推論が必要です。WikiHowやActivityNetのキャプションがデータソースとなっています。
HellaSwagの現在
発表当初は人間の正解率95%に対してモデルは48%程度でしたが、GPT-4などの最新モデルでは95%を超える性能を達成しています。このため、より困難なベンチマークの必要性が指摘されており、新しい評価基準の開発が進められています。