すべての人に一次情報を
この論文は、動画から多言語の音声を自動で文字に起こす方法を、実務者でも使いやすい形で示すことを目的としています。特に文化理解を助ける自動ツールを作るために、YouTubeなどにある“自然な”話し言葉(in-the-wild)の音声をテキスト化する手法とその精度を調べています。対象
この論文は、限られた予算で行う連続的な実験の選択を効率化する方法を扱います。特に、全ての遺伝子や条件を網羅的に試せないことが多いCRISPRスクリーニングで、どの候補を次に試すべきかを賢く決める問題が中心です。著者らは大規模な過去実験を使って学ぶことが有効だと示します。 まず研究
この論文は、音声入力で動く大規模言語モデル(SpeechLLM)が、話しながら自分の推論過程を動的に見直し修正する仕組みを提案します。著者らは、この仕組みにより複雑な推論課題での正確さを高めつつ、リアルタイムの対話で要求される低遅延を保てるかを調べました。実験はテキサス大学オース
この論文は、言語モデルが出す確率的な予測が内部で矛盾していないか(「確率的一貫性」、英語でcoherence)を調べます。研究者は古典的な定理(ド・フィネッティの定理)を用いて、モデルが提示した確率を賭けの価格とみなしたときに、常に利益を得られる賭け方(ダッチブック)が存在するか
この論文は、プログラミングコンテストで高得点を出すために言語モデルを「特化」させる手法を示します。著者らは、大量の問題集と追加の学習工程を組み合わせることで、モデルの問題解決力を大きく向上させました。国際情報オリンピック(IOI)の問題セットを用いた評価で、モデルが金メダル相当の
この論文は、テキストや数値だけでなく、画像や音、動画、3次元構造などの生データを直接読み取って、仮説提案から実験実行、論文作成まで一貫して進めるAIシステム「OmniScientist」を紹介します。重要な点は、生データの空間的・時間的・手続き的な関係を保持したまま研究を進めるこ
研究の主題は、画像と言葉の両方を扱うマルチモーダル大規模言語モデル(MLLM)の内部で働く「特徴」を見つけ出し、操作できるようにすることです。著者らはMMDiffという枠組みを提案しました。これは隠れ層の表現を疎な成分に分解する「疎自己符号化器(Sparse Autoencode
研究の要点はこうです。コードを書いて外部ツールを呼び出す「プログラマティックツール呼び出し」(PTC)は、従来のJSON(JavaScript Object Notation)形式で関数呼び出しを指示する方法に比べ、多くの場面で同等かそれ以上の正確さを示しました。著者たちは14種
この論文は、医療画像を中心に理解できる多モーダル大規模言語モデル(MLLM)「ClinFusion」を紹介します。研究者たちは、単にテキストを扱うだけでなく、X線やCT、MRIなどの2次元(2D)と3次元(3D)画像を統合して診断に役立つ出力を作ることを目指しました。彼らはモデル
この論文は、ウェブ上の公開コメントなど第三者が書き込める場所を通じて、言語モデル(LM)の事前学習データに悪意ある文を紛れ込ませることが可能かを示します。研究者は、新しい解析手法「HALFLIFE(ハーフライフ)」を導入し、注入された有害テキストがクローリングやデータ整備を経て最