ベンチマーク汚染

Benchmark Contamination

ベンチマーク汚染とは

ベンチマーク汚染(Benchmark Contamination)とは、モデルの訓練データにベンチマークのテストデータが含まれることで、評価結果が不当に高くなる問題です。データ汚染(Data Contamination)やテストセットリーク(Test Set Leakage)とも呼ばれ、大規模言語モデルの評価における重大な課題となっています。

表:ベンチマーク汚染の要点まとめ
ひとことで言うと評価用の問題が学習データに混ざっていて、成績が不当に高く出る問題。
なぜ起きるかLLMはWeb全体を学習するため、公開ベンチマークも取り込んでしまうため。
注意点公開ベンチマークの高得点だけで判断せず、自社データで必ず検証する。

汚染が起きる原因

大規模言語モデルはインターネット上の膨大なテキストデータで訓練されるため、ベンチマークの問題や回答がWeb上に公開されていると、意図せず訓練データに含まれてしまいます。MMLU、GSM8K、HellaSwagなどの有名なベンチマークは解答とともにインターネット上に広く拡散しており、汚染のリスクが高いです。

図:ベンチマーク汚染が起きるしくみ
1ベンチマークを公開Web上で誰でも見られる
▶
2学習データに混入Webごと取り込まれる
▶
3答えを覚えてしまう推論でなく暗記
▶
4高得点が出る実力を反映しない
▶
5自社データで検証これが最も確実

汚染の検出方法

汚染の検出には、訓練データとテストデータの重複検出、テスト問題の語順を変えた際の性能変化の観察、カナリアトークン(意図的に挿入した識別子)の利用などの方法があります。しかし、パラフレーズや間接的な汚染の検出は困難であり、完全な検出は現実的には難しいとされています。

汚染への対策

汚染への対策として、定期的に新しいベンチマークを作成する、非公開のテストセットを使用する、動的ベンチマーク(LMSys Chatbot Arenaのような人間評価)を活用するなどの方法が取られています。ベンチマーク汚染はLLM評価の信頼性に関わる根本的な問題であり、継続的な対策が必要です。