チェスを指しながら理由を説明するAI「Queen」:4Bパラメータでグランドマスター級の実力を達成
この論文は、チェスの強い手を示すだけでなく、その理由を自然な言葉で説明できるモデル「Queen(QUality EXplanation and E valuation Network)」を紹介します。Queenは約40億(4B)パラメータのモデルで、説明文と手の両方を同時に出力できます。研究者たちは「強さ」と「説明力」を同時に高めることを目標にしました。
研究チームは二つの主要な要素を組み合わせました。まず、チェスに特化した「エンコーダ・デコーダ」構成です。エンコーダ側には高性能のチェスネットワークLc0を置き、デコーダ側には指示に応答できる言語モデルを置きます。エンコーダの内部表現をデコーダが参照できるようにするために「クロスアテンション」という仕組みを導入し、これを質問応答(QA)のカリキュラムで学習させてチェス概念を取り出せるようにしました。次に、説明を段階的に改善する「反復蒸留」アルゴリズムを使いました。これは、候補手の先を分析して得られた説明を親の局面の説明にまとめ、それを再びモデルに蒸留(学習し直す)する手法です。七回の反復で評価値が大きく上がり、Elo評価値で約1782から2697へと約900ポイント改善したと報告しています。
評価は三つの視点で行われました。まず「正確さ」は実際の対局力の指標で、Queenの最終推定レーティングは2697で、論文に挙げられた大規模最先端モデルのGPT-5.6-Sol(2071)やGemini-3.1-Pro(2201)より高く、オンラインの中位グランドマスターのブリッツ平均(2730)に近い値です。次に「裏付け(substantiation)」は、モデルが示す主線(principal variation:想定される手順)や戦術パズルでの無誤答率で評価され、既存の手法より高いとしています。最後に「一貫性(coherence)」は言語モデルによる評価で、Queenの説明は流暢であり、GPT-5.6-Sol(高)に近づくと報告されました。注目点として、Queenはモデルサイズが小さいにもかかわらず、パラメータ数で三桁(1000倍)ほど小さいとされる最先端モデルを上回る結果を示したとしています。
なぜ重要か。従来の強いチェスエンジンは優れた評価を出しますが、人に説明はしません。一方で言語モデルは説明できても指し手が弱いことが多く、説明の価値が下がります。Queenは「強さ」と「説明力」を同時に持たせることで、プレイヤーが上達する手助けや、説明のデータを後続の言語モデルの訓練に使うなどの可能性を示します。また、論文はこの仕組みがチェス以外の領域でも応用可能であると提案しています。たとえば、ゲームやロボット制御、コンピュータ操作など、内部に強力な“沈黙する専門家”エンコーダが使える分野に応用できるかもしれません。
重要な注意点もあります。評価の一部は言語モデルを使った自動評価に依存しており、人間の主観的な評価とは異なる可能性があります。モデルの説明の良さは、まず示す手の質に依存します。つまり、良い説明を得るにはまず強い手を選べる必要があります。また、論文は他分野への「応用の可能性」を示唆していますが、実際にチェス以外で等しくうまくいくかは別途検証が必要です。最後に、提示された数値や比較は論文本体の実験条件に依存するため、別の条件での再現や独立検証が今後の課題です。