マルチモーダル大規模言語モデルでの「整合の錯覚」:内部の類似度は必ずしも画像利用を示さない
研究の主旨はこうです。視覚と文章の内部表現が似ていると測定されると、多くの研究者は「言語モデルが画像情報を取り込んでいる」と解釈します。しかし本論文は、この解釈が誤解を招くことを示します。著者らはこの現象を「整合の錯覚」と呼び、似ているという単一の数値だけでは、実際に内容レベルでのやり取りが起きているとは言えないと結論づけます。
研究者たちは制御された介入を行いました。言語モデルに入る視覚トークン(プロジェクター出力)をガウスノイズに置き換える実験と、意味のない別の画像に置き換える実験を行っています。対象はモデルファミリー5つ、合計13のマルチモーダル大規模言語モデルで、パラメータ数は0.5億から72億までです。結果は一貫しており、視覚トークンを壊すとタスク精度は大きく落ちるのに、CKA、SVCCA、MIR、先頭の主角余弦(principal-angle cosine)といった標準的なスカラー類似度指標は元データと壊したデータを確実には区別しませんでした。
なぜこうなるのか。論文は原因をモデルの「共有経路」に求めます。現在の多くのモデルは視覚エンコーダで得た特徴を言語モデルの埋め込み空間に写像(プロジェクター)し、視覚トークンとテキストトークンを同じトランスフォーマーブロックで処理します。この共有された処理過程の中の多層パーセプトロン(MLP)のダウン投影が「異方性(特定の方向に偏る性質)」を持ち、視覚とテキストのトークンを共通の出力方向に引き寄せます。こうした重み由来の効果(weight-induced alignment)が、実際の画像内容とは無関係に高い類似度を生むのです。
著者らはこれを分けて読むための指標も提案します。主角余弦スペクトルの上位2つの値の差を「PAギャップ(principal-angle gap)」と定義し、単一方向による類似と多方向的な視覚構造を分離できると主張します。実験では、段階的に視覚情報を壊す設定でPAギャップがタスク精度とより一貫して対応しました。さらに、構造はあるが無関係な画像を入れた場合に、内部の幾何学的類似性とタスク精度が乖離する領域をPAギャップが露呈しました。
重要な意味と注意点です。本研究は「内部の視覚―テキスト類似度が高い」ことだけを根拠に、モデルがその画像を利用して回答していると断定すべきではないと警告します。代わりに、類似度はモデル内部の幾何学的な診断指標として読み、制御された介入とタスク精度の証拠で補強することが必要です。論文の結果はプロジェクタ―LLMという設計に基づく13モデルで示されており、標準の類似度指標はもともと独立に訓練されたネットワーク間の比較のために設計された点も、この問題を理解する鍵だと指摘しています。