CIDErとは
CIDEr(Consensus-based Image Description Evaluation)とは、画像キャプショニング(画像に対する説明文の自動生成)の品質を評価するための指標です。2015年に提案され、複数の参照キャプションとのn-gramの一致度をTF-IDFで重み付けして計算します。
| ひとことで言うと | 画像キャプションの評価用に作られた、TF-IDFで重み付けした一致度の指標。 |
|---|---|
| 何がうれしいか | ありふれた語の一致を軽く、特徴的な語の一致を重く評価できる。 |
| 注意点 | 参照キャプションが複数必要。1つだけでは信頼性が低い。 |
CIDErの仕組み
CIDErはTF-IDF(Term Frequency-Inverse Document Frequency)の考え方を応用しています。頻出するn-gram(冠詞や一般的な表現など)の重みを下げ、画像固有の重要なn-gramの重みを上げることで、画像の内容をより正確に記述しているかを評価します。これにより、画像の特徴を的確に捉えたキャプションが高く評価されます。
1複数の参照文人が書いた説明を複数
▶
2N-gramを照合語の並びの一致
▶
3TF-IDFで重み付けありふれた語は軽く
▶
4合意度を算出人の説明との一致度
他の指標との比較
BLEUやROUGEはすべてのn-gramを均等に扱いますが、CIDErは重要度に応じた重み付けを行います。例えば「a photo of」のような一般的なフレーズの一致よりも、「golden retriever playing in the park」のような画像固有の表現の一致をより重視します。
CIDErの活用
CIDErは画像キャプショニングの研究で標準的な評価指標として使われています。MSCOCO画像キャプショニングチャレンジでも主要な評価指標の一つとして採用されています。また、強化学習を用いたキャプション生成モデルの最適化においても報酬関数としてCIDErが使用されることがあります。