画像キャプション生成

Image Captioning

画像キャプション生成とは

画像キャプション生成(Image Captioning)とは、入力画像の内容を理解し、その内容を自然言語の文章として自動生成する技術です。コンピュータビジョンと自然言語処理の両方の技術を融合したマルチモーダルAIの代表的なタスクです。

表:画像キャプション生成の要点まとめ
ひとことで言うと画像の内容を理解して、それを説明する文章を自動で作る技術。
どこで使うECの商品説明の下書き、視覚障害者向けの代替テキスト、画像検索の精度向上。
注意点細かい属性(型番・色味)を間違えることがある。公開前に確認が必要。

技術的な仕組み

画像キャプション生成の基本的なアーキテクチャは、Encoder-Decoder構造です。エンコーダにCNNやVision Transformerを使って画像の特徴を抽出し、デコーダにRNNやTransformerを使って文章を生成します。Attentionメカニズムの導入により、生成する単語に応じて画像の注目すべき領域を変化させることが可能になりました。近年ではCLIP、BLIP、Flamingo、GPT-4Vなどの大規模マルチモーダルモデルが登場し、より正確で詳細なキャプション生成が実現されています。

図:キャプション生成のしくみ
1画像を入力説明したい写真
▶
2視覚特徴を抽出何がどこにあるか
▶
3意味空間に変換言語モデルが扱える形
▶
41語ずつ生成説明文を組み立てる
▶
5文章を出力「犬が芝生で走っている」

応用と意義

画像キャプション生成は視覚障害者のための画像説明、SNSでの自動キャプション付与、画像検索の精度向上、ウェブアクセシビリティの改善などに活用されています。評価指標としてはBLEU、METEOR、CIDEr、SPICEなどが使用されますが、自動評価と人間の評価には乖離があることも課題の一つです。