arXiv News

すべての人に一次情報を

サイト

Aboutプライバシーポリシー利用規約

© 2026 arXiv News

arXiv News

英語日本語

言語を切り替え

英語日本語
アカウントを読み込み中…

すべての人に一次情報を

最新
PhiZero:映像から学んだ「物理言語」で未来の動きを推論して動画を作る世界モデルClinFusion:2Dと3D画像を統合する視覚中心の医療向け多モーダルLLMRGB動画だけで3D空間を理解するVLM-IE3D:粗い3D知識と細かい3D構造を両方使う新しい枠組み全スライド病理画像と腫瘍微小環境を効率的に解析する小型基盤モデル「GigaPath‑Flash」と「GigaTIME‑Flash」VideoRAE:既存の動画基盤モデルの表現を圧縮して生成向け潜在空間にする手法限られた角度の乳房CTで測定を厳密に守り、不確かさを校正する新しい拡散再構成法論文教材から医療画像と言葉の高品質ペアを自動生成する「MedPMC」:11百万ペアを作成しモデル性能が向上視覚を「統一されたマルチモーダル生成」として扱う新しい枠組み:SenseNova‑Visionの紹介BenchX:人種・年齢・撮像条件で変わるがん検出AIを大規模に評価するベンチマークPHAST‑Net:注意機構と物理知識で時周波数表示(スペクトログラム等)を統一的に高精度推定PhiZero:映像から学んだ「物理言語」で未来の動きを推論して動画を作る世界モデルClinFusion:2Dと3D画像を統合する視覚中心の医療向け多モーダルLLMRGB動画だけで3D空間を理解するVLM-IE3D:粗い3D知識と細かい3D構造を両方使う新しい枠組み全スライド病理画像と腫瘍微小環境を効率的に解析する小型基盤モデル「GigaPath‑Flash」と「GigaTIME‑Flash」VideoRAE:既存の動画基盤モデルの表現を圧縮して生成向け潜在空間にする手法限られた角度の乳房CTで測定を厳密に守り、不確かさを校正する新しい拡散再構成法論文教材から医療画像と言葉の高品質ペアを自動生成する「MedPMC」:11百万ペアを作成しモデル性能が向上視覚を「統一されたマルチモーダル生成」として扱う新しい枠組み:SenseNova‑Visionの紹介BenchX:人種・年齢・撮像条件で変わるがん検出AIを大規模に評価するベンチマークPHAST‑Net:注意機構と物理知識で時周波数表示(スペクトログラム等)を統一的に高精度推定

今日の記事

2026年7月31日金曜日
すべて人工知能機械学習自然言語処理コンピュータビジョンロボティクス暗号物理学数学
コンピュータビジョン注目

PhiZero:映像から学んだ「物理言語」で未来の動きを推論して動画を作る世界モデル

この論文は、映像から「物理言語」と呼ぶコンパクトな離散表現を学び、その言語の上で未来の世界の動きを推論してから映像に戻す世界モデル、PhiZero を提案します。物理言語は映像に現れる状態の変化(たとえば物が落ちる、注ぐ動きが進む)を符号化したもので、まず動きのパターンを言語の列

2026年7月31日JA2分
記事全文を読む

最新の記事

人工知能
2026年7月28日

ClinFusion:2Dと3D画像を統合する視覚中心の医療向け多モーダルLLM

この論文は、医療画像を中心に理解できる多モーダル大規模言語モデル(MLLM)「ClinFusion」を紹介します。研究者たちは、単にテキストを扱うだけでなく、X線やCT、MRIなどの2次元(2D)と3次元(3D)画像を統合して診断に役立つ出力を作ることを目指しました。彼らはモデル

JA
2分
人工知能
2026年7月24日

RGB動画だけで3D空間を理解するVLM-IE3D:粗い3D知識と細かい3D構造を両方使う新しい枠組み

この論文は、2D画像や動画から学ぶ視覚言語モデル(VLM)が、細かい3次元(3D)の空間理解や推論で苦戦する問題を扱います。著者らはRGB動画(カラー映像)だけを使い、粗い3Dの概観情報と細かい3D構造の両方をモデルに取り入れる新しい枠組み「VLM-IE3D」を提案しました。狙い

JA
2分
人工知能
2026年7月21日

全スライド病理画像と腫瘍微小環境を効率的に解析する小型基盤モデル「GigaPath‑Flash」と「GigaTIME‑Flash」

この論文は、がん病理画像(全スライド画像)を扱うための効率的な基盤モデルを紹介します。GigaPath‑Flashはギガピクセル級のスライド全体を文脈付きで表現するモデルです。GigaTIME‑Flashは日常のH&E染色画像から腫瘍の免疫微小環境に関わるタンパク質の空間分布を予

JA
2分
広告
コンピュータビジョン
2026年7月16日

VideoRAE:既存の動画基盤モデルの表現を圧縮して生成向け潜在空間にする手法

この論文は、動画を生成するための良い「潜在表現」を作る方法を示します。研究者たちは、すでに高い動画理解能力を持つ動画基盤モデル(Video Foundation Models、VFM)の出力を凍結(学習させずに固定)したまま使い、その多層的な特徴を圧縮して生成に適した潜在表現を作

JA
2分
コンピュータビジョン
2026年7月15日

限られた角度の乳房CTで測定を厳密に守り、不確かさを校正する新しい拡散再構成法

この論文は、少数の低線量投影から体積画像を作るデジタル乳房トモシンセシス(DBT: digital breast tomosynthesis)で、観測データに「完全に一致」する画像を出しつつ、生成型の学習事前分布(拡散モデル)による不確かさを正しく評価する方法を示します。代表的な

JA
2分
機械学習
2026年7月9日

論文教材から医療画像と言葉の高品質ペアを自動生成する「MedPMC」:11百万ペアを作成しモデル性能が向上

要旨:研究チームは、公開されている医学文献(PubMed Central、PMC)を自動で処理して、医療用の画像と説明文の高品質なペアを大量に作る仕組み「MedPMC」を作りました。PMCの6.1百万記事を対象にして、11百万の医療画像–文章ペアを抽出しました。目的は、画像と言語

JA
2分
コンピュータビジョン
2026年7月8日

視覚を「統一されたマルチモーダル生成」として扱う新しい枠組み:SenseNova‑Visionの紹介

この論文は、コンピュータビジョンの多彩な作業をひとつの「生成」問題としてまとめる考えを提示します。研究者たちは、テキストと画像の両方を扱える統一モデルに対して、自然言語の指示と必要なら視覚プロンプトを与えることで、出力をテキスト、画像、あるいはその混合にして返す仕組みを作りました

JA
2分
コンピュータビジョン
2026年6月24日

BenchX:人種・年齢・撮像条件で変わるがん検出AIを大規模に評価するベンチマーク

この論文は、人工知能(AI)が医用画像で高精度を示しても、実臨床では患者層や撮像手順の違いで性能が変わる問題を明らかにするための研究です。研究者たちは、その差を系統的に測る大規模な公開ベンチマークを作りました。主な着目点は、がんの検出と位置特定の性能がどのように偏るかです。 研究

JA
2分
コンピュータビジョン
2026年6月23日

PHAST‑Net:注意機構と物理知識で時周波数表示(スペクトログラム等)を統一的に高精度推定

この論文は、音声や音楽などの信号に対して「理想的な時周波数表現」を高解像度で推定する新しいニューラル手法を紹介します。理想的な時周波数表現(Ideal Time‑Frequency Representations, ITFR)とは、スペクトログラムのような周波数情報や、テンポや拍

JA
2分
次の記事を見る