arXiv News

すべての人に一次情報を

サイト

Aboutプライバシーポリシー利用規約

© 2026 arXiv News

arXiv News

英語日本語

言語を切り替え

英語日本語
アカウントを読み込み中…

すべての人に一次情報を

最新
ClinFusion:2Dと3D画像を統合する視覚中心の医療向け多モーダルLLM公開コメントで訓練データが汚染される可能性を示す研究:HALFLIFEで含有確率を推定AIエージェントは作業の「簡単さ」を見抜けるか?最小限実行を目指す手法 E3 が無駄を大幅削減大型言語モデルの「自分を見つめる力」をまとめた総説:何がわかっていて何がまだ不明かWordVoice:単語ごとの長さ・強さ・音高・声調を明示的に制御するLLMベースの音声合成LLMを検証者にする新しい方法――トークン確率を使って答えの正しさを細かく評価する技術大規模言語モデル(LLM)の出力をリアルタイムで監視する単純なしきい値法が有効と報告大規模言語モデル(LLM)が出す研究アイデアは、人間の論文アイデアよりも“偏り”があると示す研究LLMエージェントのスキル合成を一括予測するSkillComposer:どのスキルを、いくつ、どの順で使うかを生成する方法層ごとに幅を変える×字形トランスフォーマーが少ない計算で性能を改善ClinFusion:2Dと3D画像を統合する視覚中心の医療向け多モーダルLLM公開コメントで訓練データが汚染される可能性を示す研究:HALFLIFEで含有確率を推定AIエージェントは作業の「簡単さ」を見抜けるか?最小限実行を目指す手法 E3 が無駄を大幅削減大型言語モデルの「自分を見つめる力」をまとめた総説:何がわかっていて何がまだ不明かWordVoice:単語ごとの長さ・強さ・音高・声調を明示的に制御するLLMベースの音声合成LLMを検証者にする新しい方法――トークン確率を使って答えの正しさを細かく評価する技術大規模言語モデル(LLM)の出力をリアルタイムで監視する単純なしきい値法が有効と報告大規模言語モデル(LLM)が出す研究アイデアは、人間の論文アイデアよりも“偏り”があると示す研究LLMエージェントのスキル合成を一括予測するSkillComposer:どのスキルを、いくつ、どの順で使うかを生成する方法層ごとに幅を変える×字形トランスフォーマーが少ない計算で性能を改善

今日の記事

2026年7月31日金曜日
すべて人工知能機械学習自然言語処理コンピュータビジョンロボティクス暗号物理学数学
人工知能注目

ClinFusion:2Dと3D画像を統合する視覚中心の医療向け多モーダルLLM

この論文は、医療画像を中心に理解できる多モーダル大規模言語モデル(MLLM)「ClinFusion」を紹介します。研究者たちは、単にテキストを扱うだけでなく、X線やCT、MRIなどの2次元(2D)と3次元(3D)画像を統合して診断に役立つ出力を作ることを目指しました。彼らはモデル

2026年7月28日JA2分
記事全文を読む

最新の記事

人工知能
2026年7月17日

公開コメントで訓練データが汚染される可能性を示す研究:HALFLIFEで含有確率を推定

この論文は、ウェブ上の公開コメントなど第三者が書き込める場所を通じて、言語モデル(LM)の事前学習データに悪意ある文を紛れ込ませることが可能かを示します。研究者は、新しい解析手法「HALFLIFE(ハーフライフ)」を導入し、注入された有害テキストがクローリングやデータ整備を経て最

JA
2分
人工知能
2026年7月15日

AIエージェントは作業の「簡単さ」を見抜けるか?最小限実行を目指す手法 E3 が無駄を大幅削減

この論文は、開発や情報処理を自動化する大規模言語モデル(LLM:Large Language Model)を使うエージェントが、作業に本当にどれだけの手間が必要かを判断できないことに注目しています。多くのエージェントは「まずできるだけ多くの情報を読む」戦略を取りがちで、ほんの一行

JA
2分
人工知能
2026年7月14日

大型言語モデルの「自分を見つめる力」をまとめた総説:何がわかっていて何がまだ不明か

この論文は「メタ認知」と呼ばれる、自分の考えや判断を評価し調整する能力を大型言語モデル(LLM, Large Language Model)に当てはめて検討した初めての包括的なレビューです。著者らはメタ認知を、実行中の状態を監視する「モニタリング」と、その結果に基づいて行動を変え

JA
2分
広告
自然言語処理
2026年7月8日

WordVoice:単語ごとの長さ・強さ・音高・声調を明示的に制御するLLMベースの音声合成

本論文は、LLM(Large Language Model:大規模言語モデル)を用いたTTS(Text-to-Speech:文章読み上げ)で、単語単位の音響属性を明示的にかつ多次元で制御する枠組み「WordVoice」を提案します。従来のエンドツーエンド型の音声合成は自然さが出て

JA
2分
人工知能
2026年7月7日

LLMを検証者にする新しい方法――トークン確率を使って答えの正しさを細かく評価する技術

この論文は「LLM-as-a-Verifier」という新しい検証フレームワークを提案しています。ここで言う検証とは、提示された解答や行動列(トラジェクトリ)が正しいかを判断することです。研究者らは、大規模言語モデル(LLM)の追加学習をせずに、モデルが出す各トークンの確率(ロジッ

JA
2分
人工知能
2026年7月3日

大規模言語モデル(LLM)の出力をリアルタイムで監視する単純なしきい値法が有効と報告

この論文は、実際に動く大規模言語モデル(LLM)が安全でない出力を出す場面をリアルタイムに監視し、早期に止める仕組みについて報告します。研究者たちは、外部の検証モデルが出す「安全である確率」を受け取り、単純なしきい値で危険を判断する監視器を提案しました。しきい値は「リスク制御」と

JA
2分
人工知能
2026年7月2日

大規模言語モデル(LLM)が出す研究アイデアは、人間の論文アイデアよりも“偏り”があると示す研究

要点:この研究は、大規模言語モデル(LLM)が生み出す研究アイデアが、人間研究者が実際に書いた論文のアイデアと比べてどれだけ似ているかを調べます。著者らは「分布的な味の差(research taste gap)」に注目し、結果としてLLMのアイデアは人間のそれよりも狭く、特に“つ

JA
2分
自然言語処理
2026年7月1日

LLMエージェントのスキル合成を一括予測するSkillComposer:どのスキルを、いくつ、どの順で使うかを生成する方法

この論文は、複雑な作業をこなすためにエージェントが使う「スキル」をどのように選んで組み合わせるかを自動で決める方法を示します。ここでいうスキルは、手順や説明、補助コードなどをまとめた再利用可能なモジュールです。研究者たちは、どのスキルを使うか、何個使うか、どの順番で実行するかの三

JA
2分
自然言語処理
2026年6月17日

層ごとに幅を変える×字形トランスフォーマーが少ない計算で性能を改善

この論文は、トランスフォーマー型の言語モデルで「層ごとの幅(隠れ次元)」を一定にしない設計を試したものです。研究者は、前半と後半の層を広くし、中間層を狭くする×字形(バツ字)プロファイルのモデルを提案しました。こうした非一様な幅割り当てで、同じパラメータ数の均一幅モデルよりも言語

JA
2分
次の記事を見る