すべての人に一次情報を
この論文は、大規模言語モデル(LLM)が質問に答える過程で「どの情報を使うか」をどのように切り替えるかを調べています。研究者たちは、質問文の終わり時点における内部の隠れ状態(層ごとの中間表現)に手を入れる手法を使い、Qwen、Llama、Gemmaという三つのモデルで比較実験を行
この論文は、人工エージェントに「人工id」と呼ぶ内部ドライブを持たせる設計を提案します。これにより、エージェントが行動を続けるか、やめるか、切り替えるかを自分の内部で決められるようになります。近年、大規模言語モデル(LLM)は単発の作業から継続的に動き状態を保つエージェントへ移り
この論文は、限られた予算で行う連続的な実験の選択を効率化する方法を扱います。特に、全ての遺伝子や条件を網羅的に試せないことが多いCRISPRスクリーニングで、どの候補を次に試すべきかを賢く決める問題が中心です。著者らは大規模な過去実験を使って学ぶことが有効だと示します。 まず研究
この論文は、音声入力で動く大規模言語モデル(SpeechLLM)が、話しながら自分の推論過程を動的に見直し修正する仕組みを提案します。著者らは、この仕組みにより複雑な推論課題での正確さを高めつつ、リアルタイムの対話で要求される低遅延を保てるかを調べました。実験はテキサス大学オース
この論文は、散らかった屋内空間をヒューマノイドロボットが安全に移動する方法を扱います。従来の研究は床面の2次元経路計画に注目しがちですが、狭い場所や障害物の多い場所では腕の位置、胴体の角度、歩き方など全身の連携が必要です。著者らはこうした「全身」適応を言葉で指示された移動タスクに
この論文は、LLMが出力と一緒に示す「上位3つの影響要因」が実際にその出力にどれだけ影響しているかを、観察できる振る舞いで確かめる方法を示します。研究者は、提示された要因を「必要(それを変えれば出力が変わる)」と「十分(それを残して他を取り除けば出力が保たれる)」の二つの意味で評
この論文は、同じ呼び出しを同じモデル名に送れば結果は明日も同じだという前提を検証しました。研究者たちは、言語モデルを「判定者(ジャッジ)」として使う評価やデータ選別が増える中で、この前提が測定器としての信頼性を支えていると指摘し、実際に同じ条件で再現性があるかどうかを事前に決めた
この論文は、言語モデルが出す確率的な予測が内部で矛盾していないか(「確率的一貫性」、英語でcoherence)を調べます。研究者は古典的な定理(ド・フィネッティの定理)を用いて、モデルが提示した確率を賭けの価格とみなしたときに、常に利益を得られる賭け方(ダッチブック)が存在するか
この論文は、プログラミングコンテストで高得点を出すために言語モデルを「特化」させる手法を示します。著者らは、大量の問題集と追加の学習工程を組み合わせることで、モデルの問題解決力を大きく向上させました。国際情報オリンピック(IOI)の問題セットを用いた評価で、モデルが金メダル相当の
この論文は、私たちの代わりに行動するAIが何を望み、何ができるか分からない状況で、どうやってAIをうまく使えるかを考えたものです。研究者たちは、AIの好み(この論文では「整合性」や「バイアス」と表現)と実際にできること(能力や得られる情報)が設計者にとって未知であることを出発点に