arXiv News

すべての人に一次情報を

サイト

Aboutプライバシーポリシー利用規約

© 2026 arXiv News

arXiv News

英語日本語

言語を切り替え

英語日本語
アカウントを読み込み中…

すべての人に一次情報を

最新
AIは自律的にAI研究を行えるか?「シャドウ評価」で2件のNeurIPS論文を試した結果OmniQEC:大規模量子計算のためにAIが実装向けの誤り訂正符号を発見する仕組みClinFusion:2Dと3D画像を統合する視覚中心の医療向け多モーダルLLMRGB動画だけで3D空間を理解するVLM-IE3D:粗い3D知識と細かい3D構造を両方使う新しい枠組みスマートグリッド向けLLMとエージェントの新しい設計ルール:信頼できるソルバーで数値を検証してから報告する全スライド病理画像と腫瘍微小環境を効率的に解析する小型基盤モデル「GigaPath‑Flash」と「GigaTIME‑Flash」公開コメントで訓練データが汚染される可能性を示す研究:HALFLIFEで含有確率を推定AIエージェントは作業の「簡単さ」を見抜けるか?最小限実行を目指す手法 E3 が無駄を大幅削減大型言語モデルの「自分を見つめる力」をまとめた総説:何がわかっていて何がまだ不明かエージェント型AIの「自律的なモデル発見」を実験設計で評価—CodexとClaude Codeを比較AIは自律的にAI研究を行えるか?「シャドウ評価」で2件のNeurIPS論文を試した結果OmniQEC:大規模量子計算のためにAIが実装向けの誤り訂正符号を発見する仕組みClinFusion:2Dと3D画像を統合する視覚中心の医療向け多モーダルLLMRGB動画だけで3D空間を理解するVLM-IE3D:粗い3D知識と細かい3D構造を両方使う新しい枠組みスマートグリッド向けLLMとエージェントの新しい設計ルール:信頼できるソルバーで数値を検証してから報告する全スライド病理画像と腫瘍微小環境を効率的に解析する小型基盤モデル「GigaPath‑Flash」と「GigaTIME‑Flash」公開コメントで訓練データが汚染される可能性を示す研究:HALFLIFEで含有確率を推定AIエージェントは作業の「簡単さ」を見抜けるか?最小限実行を目指す手法 E3 が無駄を大幅削減大型言語モデルの「自分を見つめる力」をまとめた総説:何がわかっていて何がまだ不明かエージェント型AIの「自律的なモデル発見」を実験設計で評価—CodexとClaude Codeを比較

今日の記事

2026年7月31日金曜日
すべて人工知能機械学習自然言語処理コンピュータビジョンロボティクス暗号物理学数学
人工知能注目

AIは自律的にAI研究を行えるか?「シャドウ評価」で2件のNeurIPS論文を試した結果

この論文は、人工知能(AI)エージェントが自律的にオープンエンドのAI研究を行えるかを調べた最初期の証拠を報告します。研究チームは「シャドウ評価」と呼ぶ新しい方法を使いました。シャドウ評価では、未公開の高品質な研究論文の中心的な研究課題をAIに与え、その出力を論文の元の著者が査読

2026年7月30日JA2分
記事全文を読む

最新の記事

人工知能
2026年7月29日

OmniQEC:大規模量子計算のためにAIが実装向けの誤り訂正符号を発見する仕組み

この論文は、実際の量子プロセッサ上でうまく動く誤り訂正(QEC)符号を人工知能で自動発見する仕組み「OmniQEC」を紹介します。重要な点は、単に数学的な符号の性質だけでなく、実際の回路での誤り率(論理誤り率)を直接最適化しようとする点です。OmniQECは大規模言語モデル(LL

JA
2分
人工知能
2026年7月28日

ClinFusion:2Dと3D画像を統合する視覚中心の医療向け多モーダルLLM

この論文は、医療画像を中心に理解できる多モーダル大規模言語モデル(MLLM)「ClinFusion」を紹介します。研究者たちは、単にテキストを扱うだけでなく、X線やCT、MRIなどの2次元(2D)と3次元(3D)画像を統合して診断に役立つ出力を作ることを目指しました。彼らはモデル

JA
2分
人工知能
2026年7月24日

RGB動画だけで3D空間を理解するVLM-IE3D:粗い3D知識と細かい3D構造を両方使う新しい枠組み

この論文は、2D画像や動画から学ぶ視覚言語モデル(VLM)が、細かい3次元(3D)の空間理解や推論で苦戦する問題を扱います。著者らはRGB動画(カラー映像)だけを使い、粗い3Dの概観情報と細かい3D構造の両方をモデルに取り入れる新しい枠組み「VLM-IE3D」を提案しました。狙い

JA
2分
広告
人工知能
2026年7月21日

スマートグリッド向けLLMとエージェントの新しい設計ルール:信頼できるソルバーで数値を検証してから報告する

この論文は、大型言語モデル(LLM, Large Language Models)と“エージェント的”AIを電力系統(スマートグリッド)で安全に使うための設計原則と実例を示します。著者は「ソルバー(信頼できる数値計算ツール)に基づく設計」を提案します。要点は、数値結果は必ず信頼で

JA
2分
人工知能
2026年7月21日

全スライド病理画像と腫瘍微小環境を効率的に解析する小型基盤モデル「GigaPath‑Flash」と「GigaTIME‑Flash」

この論文は、がん病理画像(全スライド画像)を扱うための効率的な基盤モデルを紹介します。GigaPath‑Flashはギガピクセル級のスライド全体を文脈付きで表現するモデルです。GigaTIME‑Flashは日常のH&E染色画像から腫瘍の免疫微小環境に関わるタンパク質の空間分布を予

JA
2分
人工知能
2026年7月17日

公開コメントで訓練データが汚染される可能性を示す研究:HALFLIFEで含有確率を推定

この論文は、ウェブ上の公開コメントなど第三者が書き込める場所を通じて、言語モデル(LM)の事前学習データに悪意ある文を紛れ込ませることが可能かを示します。研究者は、新しい解析手法「HALFLIFE(ハーフライフ)」を導入し、注入された有害テキストがクローリングやデータ整備を経て最

JA
2分
人工知能
2026年7月15日

AIエージェントは作業の「簡単さ」を見抜けるか?最小限実行を目指す手法 E3 が無駄を大幅削減

この論文は、開発や情報処理を自動化する大規模言語モデル(LLM:Large Language Model)を使うエージェントが、作業に本当にどれだけの手間が必要かを判断できないことに注目しています。多くのエージェントは「まずできるだけ多くの情報を読む」戦略を取りがちで、ほんの一行

JA
2分
人工知能
2026年7月14日

大型言語モデルの「自分を見つめる力」をまとめた総説:何がわかっていて何がまだ不明か

この論文は「メタ認知」と呼ばれる、自分の考えや判断を評価し調整する能力を大型言語モデル(LLM, Large Language Model)に当てはめて検討した初めての包括的なレビューです。著者らはメタ認知を、実行中の状態を監視する「モニタリング」と、その結果に基づいて行動を変え

JA
2分
人工知能
2026年7月8日

エージェント型AIの「自律的なモデル発見」を実験設計で評価—CodexとClaude Codeを比較

要点:研究者たちは、大規模言語モデルを使うコーディングエージェントが行う「自律的なモデル発見」の振る舞いを、単発のベンチマークではなく系統的な実験で評価する枠組みを提案しました。これらのエージェントは確率的で順応的に動くため、動作のばらつきや費用とのトレードオフを複数回の制御実験

JA
2分
次の記事を見る