SQuADとは
SQuAD(Stanford Question Answering Dataset)とは、スタンフォード大学が開発した機械読解(Reading Comprehension)のベンチマークデータセットです。Wikipedia記事を基にした質問応答ペアで構成されており、モデルが与えられた文章から質問に対する回答を抽出する能力を評価します。
| ひとことで言うと | 文章を読んで質問に答える力を測る、読解ベンチマーク。 |
|---|---|
| どこで使う | 質問応答モデルの評価、RAGの読解部分の性能確認。 |
| 注意点 | 答えが本文中にそのままある形式。生成型の回答品質は測れない。 |
SQuADのバージョン
SQuAD 1.1は10万以上の質問からなり、すべての質問に対して文章中に回答が存在します。SQuAD 2.0はこれに約5万の回答不可能な質問を追加し、モデルが「回答できない」と判断する能力も評価します。SQuAD 2.0はより現実的な読解理解能力を測定できます。
1本文と質問を与えるWikipedia記事など
▶
2答えの箇所を抽出本文中の範囲を指す
▶
3正解と照合完全一致とF値で採点
▶
4読解力を評価人間スコアと比較
評価指標
SQuADの主な評価指標はEM(Exact Match、完全一致)とF1スコアです。EMはモデルの回答が正解と完全に一致する割合、F1スコアはトークンレベルの適合率と再現率の調和平均です。F1スコアは部分的な一致も評価するため、EMよりも緩やかな指標です。
SQuADの影響と現状
SQuADはBERTやXLNetなどの事前学習モデルの性能実証に大きな役割を果たしました。多くのモデルが人間レベルの性能を達成しており、現在はより高度な推論を必要とするベンチマーク(Natural Questions、DROP、HotpotQAなど)に注目が移っています。