arXiv News

すべての人に一次情報を

サイト

Aboutプライバシーポリシー利用規約

© 2026 arXiv News

arXiv News

英語日本語

言語を切り替え

英語日本語
アカウントを読み込み中…

すべての人に一次情報を

最新
YouTube動画の多言語音声をWhisperで文字起こし:微調整で誤り率が約30%から約20%へ1,389件のCRISPRスクリーニングで学ぶ効率的なヒット探索:実験データと大規模言語モデルを組み合わせる新手法RetroThinker:音声で動く大規模言語モデルが自分の思考を後から見直せるようにする方法言語モデルの「確率」が矛盾していないかを調べる方法とその発見ポストトレーニングで言語モデルがIOIで金メダル相当の成績を達成OmniScientist:生の多様な証拠から研究を自動で進める「オムニモーダル」AI研究者MMDiff:マルチモーダル大規模言語モデルの内部特徴を発見し操作する方法コードで道具を呼ぶときの教訓:プログラム呼び出しは多くのモデルでJSON呼び出しを上回るClinFusion:2Dと3D画像を統合する視覚中心の医療向け多モーダルLLM公開コメントで訓練データが汚染される可能性を示す研究:HALFLIFEで含有確率を推定YouTube動画の多言語音声をWhisperで文字起こし:微調整で誤り率が約30%から約20%へ1,389件のCRISPRスクリーニングで学ぶ効率的なヒット探索:実験データと大規模言語モデルを組み合わせる新手法RetroThinker:音声で動く大規模言語モデルが自分の思考を後から見直せるようにする方法言語モデルの「確率」が矛盾していないかを調べる方法とその発見ポストトレーニングで言語モデルがIOIで金メダル相当の成績を達成OmniScientist:生の多様な証拠から研究を自動で進める「オムニモーダル」AI研究者MMDiff:マルチモーダル大規模言語モデルの内部特徴を発見し操作する方法コードで道具を呼ぶときの教訓:プログラム呼び出しは多くのモデルでJSON呼び出しを上回るClinFusion:2Dと3D画像を統合する視覚中心の医療向け多モーダルLLM公開コメントで訓練データが汚染される可能性を示す研究:HALFLIFEで含有確率を推定

今日の記事

2026年9月14日月曜日
すべて人工知能機械学習自然言語処理コンピュータビジョンロボティクス暗号物理学数学
自然言語処理注目

YouTube動画の多言語音声をWhisperで文字起こし:微調整で誤り率が約30%から約20%へ

この論文は、動画から多言語の音声を自動で文字に起こす方法を、実務者でも使いやすい形で示すことを目的としています。特に文化理解を助ける自動ツールを作るために、YouTubeなどにある“自然な”話し言葉(in-the-wild)の音声をテキスト化する手法とその精度を調べています。対象

2026年9月12日JA2分
記事全文を読む

最新の記事

人工知能
2026年9月11日

1,389件のCRISPRスクリーニングで学ぶ効率的なヒット探索:実験データと大規模言語モデルを組み合わせる新手法

この論文は、限られた予算で行う連続的な実験の選択を効率化する方法を扱います。特に、全ての遺伝子や条件を網羅的に試せないことが多いCRISPRスクリーニングで、どの候補を次に試すべきかを賢く決める問題が中心です。著者らは大規模な過去実験を使って学ぶことが有効だと示します。 まず研究

JA
2分
人工知能
2026年9月11日

RetroThinker:音声で動く大規模言語モデルが自分の思考を後から見直せるようにする方法

この論文は、音声入力で動く大規模言語モデル(SpeechLLM)が、話しながら自分の推論過程を動的に見直し修正する仕組みを提案します。著者らは、この仕組みにより複雑な推論課題での正確さを高めつつ、リアルタイムの対話で要求される低遅延を保てるかを調べました。実験はテキサス大学オース

JA
2分
人工知能
2026年9月3日

言語モデルの「確率」が矛盾していないかを調べる方法とその発見

この論文は、言語モデルが出す確率的な予測が内部で矛盾していないか(「確率的一貫性」、英語でcoherence)を調べます。研究者は古典的な定理(ド・フィネッティの定理)を用いて、モデルが提示した確率を賭けの価格とみなしたときに、常に利益を得られる賭け方(ダッチブック)が存在するか

JA
2分
広告
人工知能
2026年9月3日

ポストトレーニングで言語モデルがIOIで金メダル相当の成績を達成

この論文は、プログラミングコンテストで高得点を出すために言語モデルを「特化」させる手法を示します。著者らは、大量の問題集と追加の学習工程を組み合わせることで、モデルの問題解決力を大きく向上させました。国際情報オリンピック(IOI)の問題セットを用いた評価で、モデルが金メダル相当の

JA
2分
人工知能
2026年8月14日

OmniScientist:生の多様な証拠から研究を自動で進める「オムニモーダル」AI研究者

この論文は、テキストや数値だけでなく、画像や音、動画、3次元構造などの生データを直接読み取って、仮説提案から実験実行、論文作成まで一貫して進めるAIシステム「OmniScientist」を紹介します。重要な点は、生データの空間的・時間的・手続き的な関係を保持したまま研究を進めるこ

JA
2分
人工知能
2026年8月11日

MMDiff:マルチモーダル大規模言語モデルの内部特徴を発見し操作する方法

研究の主題は、画像と言葉の両方を扱うマルチモーダル大規模言語モデル(MLLM)の内部で働く「特徴」を見つけ出し、操作できるようにすることです。著者らはMMDiffという枠組みを提案しました。これは隠れ層の表現を疎な成分に分解する「疎自己符号化器(Sparse Autoencode

JA
2分
自然言語処理
2026年8月7日

コードで道具を呼ぶときの教訓:プログラム呼び出しは多くのモデルでJSON呼び出しを上回る

研究の要点はこうです。コードを書いて外部ツールを呼び出す「プログラマティックツール呼び出し」(PTC)は、従来のJSON(JavaScript Object Notation)形式で関数呼び出しを指示する方法に比べ、多くの場面で同等かそれ以上の正確さを示しました。著者たちは14種

JA
2分
人工知能
2026年7月28日

ClinFusion:2Dと3D画像を統合する視覚中心の医療向け多モーダルLLM

この論文は、医療画像を中心に理解できる多モーダル大規模言語モデル(MLLM)「ClinFusion」を紹介します。研究者たちは、単にテキストを扱うだけでなく、X線やCT、MRIなどの2次元(2D)と3次元(3D)画像を統合して診断に役立つ出力を作ることを目指しました。彼らはモデル

JA
2分
人工知能
2026年7月17日

公開コメントで訓練データが汚染される可能性を示す研究:HALFLIFEで含有確率を推定

この論文は、ウェブ上の公開コメントなど第三者が書き込める場所を通じて、言語モデル(LM)の事前学習データに悪意ある文を紛れ込ませることが可能かを示します。研究者は、新しい解析手法「HALFLIFE(ハーフライフ)」を導入し、注入された有害テキストがクローリングやデータ整備を経て最

JA
2分
次の記事を見る