Multimodal Flow:言語と画像を「連続ベクトル」で同時に扱う新しい生成モデル
研究の要点は、言葉と画像を同じ連続的な表現で一緒に生成する「Multimodal Flow(多モーダルフロー)」というモデルの提案です。従来の方法は画像を離散的なトークンに変換したり、言語は離散、画像は連続といった混合の設計が多く、どちらも欠点がありました。著者らはあえてすべてを連続ベクトル(埋め込み)で扱うことで、共通の生成過程を作れることを示そうとしています。連続で扱うことで、画像の量子化(画質や情報を切り捨てる処理)による制約や、モダリティごとに別々の目的関数やサンプリング手順が必要になる問題を避けられると説明しています。
彼らが作ったモデルの中核は「チャンク因果フロー(chunk-causal flow)」という仕組みです。具体的には、テキストの語句と画像を空間的なまとまりとして「ハイパーチャンク」と呼ぶ連続的な塊にして順序を保ちます。フローはこれらのハイパーチャンク上の単一のベクトル場(ベクトルの流れ)を学習します。ここで用いる「Flow Matching(フローマッチング)」は、そのベクトル場を学ぶための手法です。クロスモーダルなやりとりは「joint attention(結合注意)」で行い、各モダリティ(言語・視覚)には専用の処理層が入ります。訓練時は複数の目標チャンクを同時に予測し、推論時はハイパーチャンクを順に生成します。提案モデルの実装はMF-1として公開され、コードも公開されています(https://github.com/hustvl/Multimodal-Flow)。
実験では、パラメータ規模0.6B、1.2B、1.6Bの設定で事前学習を続けると性能が一貫して改善することが報告されています。さらに、事前学習トークン数が150Bと比較的少ない量でも、ベンチマークの結果は有望でした。具体的にはGenEvalとDPG-Benchの平均スコアが82.8、VQAv2、MMBench、POPEの平均が75.3という数値を示しています。著者は、データ量や最適化、パラメータ量を揃えた条件下では、代表的なハイブリッド(混合)や離散モデルより優れていると述べています。
なぜ重要かというと、もしこの「完全に連続」のやり方が広く使えれば、異なる情報(言語・画像)を一つの生成過程で自然に結びつけられます。これにより、モダリティごとに別個の設計や複雑な変換を用意する必要が減り、より統一的でシンプルなマルチモーダルモデル設計が可能になります。公開コードにより、他の研究者が再現や拡張を試せる点も前向きです。
ただし注意点もあります。本稿の結果は提示されたベンチマークと訓練条件に基づくものです。完全に連続で扱う手法自体はこれまであまり試されておらず、より大規模なデータや別のタスク、実運用での挙動などを含めた追加検証が必要です。また論文は「競争力がある」と報告しており、すべての場面で既存手法を上回ると断定しているわけではありません。興味がある読者は、公開された実装で詳しい比較や再現性の確認を行うと良いでしょう。