マルチモーダルモデル

Multimodal Model

マルチモーダルモデルとは

マルチモーダルモデル(Multimodal Model)とは、テキスト、画像、音声、動画などの複数の入出力モダリティに対応した機械学習モデルです。単一のモデルアーキテクチャで異なる種類のデータを処理できるよう設計されており、GPT-4o、Gemini、Claude 3.5 Sonnetなどの最先端モデルがこれに該当します。

表:マルチモーダルモデルの要点まとめ
ひとことで言うと複数種類のデータを、1つのモデルの中で結びつけて学習したモデル。
どこで使う画像と説明文の横断検索、図表つき資料の読解、動画の内容理解。
注意点学習データの組み合わせが偏ると、特定の対応づけしかできなくなる。

主要なマルチモーダルモデル

GPT-4oは入力としてテキスト・画像・音声を受け付け、テキスト・画像・音声での出力が可能な統合モデルです。Geminiは当初からマルチモーダルとして設計され、テキスト・画像・音声・動画・コードを統合的に処理します。Claude 3.5はテキストと画像の入力に対応し、特にドキュメントやチャート画像の理解に優れています。オープンソースではLLaVA、InternVLなどが代表的です。

図:画像と文章が結びつくしくみ
1画像を数値化画像エンコーダで変換
▶
2文章を数値化テキストエンコーダで変換
▶
3ペアを近づける対応する組を寄せて学習
▶
4共通の意味空間画像と文が同じ土俵に
▶
5横断して検索文から画像、画像から文

マルチモーダルモデルの展望

マルチモーダルモデルの進化は加速しており、対応するモダリティの数と処理精度は年々向上しています。今後はリアルタイムの音声会話、動画の理解と生成、3D空間の認識、触覚情報の処理など、より多くのモダリティへの対応が期待されています。任意のモダリティ間で変換・生成ができる「Any-to-Any」モデルの実現が次の大きなマイルストーンとされています。