PriceBench:LLMがホテルを選ぶ「好み」を数値化する診断ベンチマーク
この論文は、大型言語モデル(LLM)が実際に何を買うかを明らかにするためのベンチマーク「PriceBench」を紹介します。研究者たちは、ホテルの予約という単純で選択肢が比較しやすい場面を使い、LLMが価格、品質、ブランドのどれをどれだけ重視するかを推定しました。重要なのは、ユーザーが指定した条件を満たす複数の候補があるとき、最終的にどれを選ぶかでその「好み」が露呈する点です。著者らは解析に必要なタスク、コード、28モデル分の回答セットを公開しています。
彼らがやったことは次の通りです。179軒の実在するニューヨーク市のホテルを使い、合計3,600件の予約タスクを作成しました。これを8社の28個のLLMに与え、モデルごとの選択を記録します。選択データにはロジット選択モデル(logit choice model)という統計手法を当てはめ、価格やレビュー点数、チェーンか独立かといった属性が選択にどれだけ影響するかを数値として回収しました。簡単に言えば、複数の候補を見せてどれを選ぶかを見れば、そのモデルの好みを推定できる、という手順です。
得られた主な発見は二つあります。第一に、モデルの「能力」は何を選ぶかではなく、選び方の一貫性に強く関係します。より能力の高いLLMは一貫して強い好みを示します。逆に弱いモデルは、並び順に引きずられて同じ位置の候補ばかり選ぶか、ほとんど無差別に選んでしまう傾向があり得ます。第二に、どの属性を好むかはモデル間で大きく異なります。価格感度はモデル間で10倍以上の幅があり、価格と品質のトレードオフが同じタスクで平均宿泊料金をおよそ247ドルから393ドルまで変えました。ブランドに対する好みもモデルごとにばらつき、同じ提供者の兄弟モデルでも違いが出ることが報告されています。
なぜこれが重要かというと、LLMを購買エージェントとして使う場合、何が買われるかは単にユーザーの条件だけで決まらず、使うモデル自体の「好み」に依存するからです。売り手はモデルごとの好みを見越して価格や表示順を調整できるし、サービス提供者は事前に各モデルの好みを計測しておく必要があります。PriceBenchはそのための単純で再現可能な診断方法を提供します。
ただし限界も明確に述べられています。本研究はニューヨーク市のホテルに限定した検証です。別の商品カテゴリ(食料、航空券、ソフトウエアなど)では感度が異なる可能性があります。推定は「温度0(決定的出力)」の単一の中立プロンプトに条件付けられており、ツールを使う多段対話型エージェントやサンプリングデコードでは未検証です。さらに、金額換算の結果は提示形式に依存しますし、人間の実際の選択と直接比較するための同一タスクでの人間データはまだ集められていません。加えて、能力と選択の一貫性の関連は28モデルの横断的観察に基づくため、モデル構成や学習データ、調整手法が因果的にどう影響するかはこのデータだけでは決定できません。