ScholarCatalyst:新しい研究に「発想を与える」過去論文を見つけられるかを測るベンチマーク
この論文は、新しい研究に役立つ過去の論文を見つける能力を調べるためのデータセットと課題を示します。研究者自身が「この先行研究が自分の成果を進めた」と認めた例を集めて、機械がどれだけ同じ候補を見つけられるかを測ります。目的は、未完成のアイデアを持つときに参考にすべき先行研究を指し示せる「科学支援エージェント」構築の一歩です。
研究チームは自動化したパイプラインを使い、規模を拡張して注釈を集めました。具体的には、コンピュータサイエンス分野の最近の論文207件について、184名の筆頭著者がどの候補論文がプロジェクトを進めた(あるいは進められた)かをラベリングし、各選択に詳細な説明(理由)を付けました。評価課題は「ある初期の研究問題が与えられたとき、その時点で入手可能だった文献群から該当の先行研究を検索して返す」というものです。
実験では、いくつかの検索方法を比べました。埋め込み検索(embedding retrieval)は上位20件での再現率(Recall@20)で0.48を記録しました。一方、検索ツールを呼び出すように動く「エージェント的検索」は0.42にとどまり、同じ検索器を使っても性能向上は見られませんでした。さらに、学習時に完成した論文を見ている可能性のある大規模言語モデルClaude Fable 5.1を用いたエージェントでも0.51 R@20にとどまりました。ここでのRecall@20は、正解とした先行研究が上位20件の提案に含まれる割合を指します。
これらの結果は、現状のモデルが専門家の「直感」に相当する検索力を十分には持っていないことを示しています。著者は、モデルに幅広い文献から有用なアイデアを見つける専門的な直観を与えるための新しい学習方法が必要だと指摘します。最終的な目標は、半ば形になったアイデアを与えると、適切な先行研究を指し示して研究を前に進められるエージェントの実現です。
重要な注意点もあります。本データセットはコンピュータサイエンス領域の最近の論文に限られます(207件、184人の筆頭著者)。また、Claude Fable 5.1のようなモデルは訓練時に完成論文を目にしている可能性があり、完全な公平比較が難しい場合があります。注釈は著者の判断に依るため主観性やバイアスが入り得ます。データとコードは公開されており、プロジェクトページやGitHub、Hugging Faceで確認できます(https://github.com/stanford-iris-lab/ScholarCatalyst、https://ohmyksh.github.io/project/ScholarCatalyst/、https://huggingface.co/ScholarCatalyst)。