すべての人に一次情報を
この論文は、医療画像を中心に理解できる多モーダル大規模言語モデル(MLLM)「ClinFusion」を紹介します。研究者たちは、単にテキストを扱うだけでなく、X線やCT、MRIなどの2次元(2D)と3次元(3D)画像を統合して診断に役立つ出力を作ることを目指しました。彼らはモデル
この論文は、ウェブ上の公開コメントなど第三者が書き込める場所を通じて、言語モデル(LM)の事前学習データに悪意ある文を紛れ込ませることが可能かを示します。研究者は、新しい解析手法「HALFLIFE(ハーフライフ)」を導入し、注入された有害テキストがクローリングやデータ整備を経て最
この論文は、開発や情報処理を自動化する大規模言語モデル(LLM:Large Language Model)を使うエージェントが、作業に本当にどれだけの手間が必要かを判断できないことに注目しています。多くのエージェントは「まずできるだけ多くの情報を読む」戦略を取りがちで、ほんの一行
この論文は「メタ認知」と呼ばれる、自分の考えや判断を評価し調整する能力を大型言語モデル(LLM, Large Language Model)に当てはめて検討した初めての包括的なレビューです。著者らはメタ認知を、実行中の状態を監視する「モニタリング」と、その結果に基づいて行動を変え
本論文は、LLM(Large Language Model:大規模言語モデル)を用いたTTS(Text-to-Speech:文章読み上げ)で、単語単位の音響属性を明示的にかつ多次元で制御する枠組み「WordVoice」を提案します。従来のエンドツーエンド型の音声合成は自然さが出て
この論文は「LLM-as-a-Verifier」という新しい検証フレームワークを提案しています。ここで言う検証とは、提示された解答や行動列(トラジェクトリ)が正しいかを判断することです。研究者らは、大規模言語モデル(LLM)の追加学習をせずに、モデルが出す各トークンの確率(ロジッ
この論文は、実際に動く大規模言語モデル(LLM)が安全でない出力を出す場面をリアルタイムに監視し、早期に止める仕組みについて報告します。研究者たちは、外部の検証モデルが出す「安全である確率」を受け取り、単純なしきい値で危険を判断する監視器を提案しました。しきい値は「リスク制御」と
要点:この研究は、大規模言語モデル(LLM)が生み出す研究アイデアが、人間研究者が実際に書いた論文のアイデアと比べてどれだけ似ているかを調べます。著者らは「分布的な味の差(research taste gap)」に注目し、結果としてLLMのアイデアは人間のそれよりも狭く、特に“つ
この論文は、複雑な作業をこなすためにエージェントが使う「スキル」をどのように選んで組み合わせるかを自動で決める方法を示します。ここでいうスキルは、手順や説明、補助コードなどをまとめた再利用可能なモジュールです。研究者たちは、どのスキルを使うか、何個使うか、どの順番で実行するかの三
この論文は、トランスフォーマー型の言語モデルで「層ごとの幅(隠れ次元)」を一定にしない設計を試したものです。研究者は、前半と後半の層を広くし、中間層を狭くする×字形(バツ字)プロファイルのモデルを提案しました。こうした非一様な幅割り当てで、同じパラメータ数の均一幅モデルよりも言語