arXiv News

すべての人に一次情報を

サイト

Aboutプライバシーポリシー利用規約

© 2026 arXiv News

arXiv News

英語日本語

言語を切り替え

英語日本語
アカウントを読み込み中…

すべての人に一次情報を

最新
SenseNova-U1.5:エンコーダー不要の「統合型」視覚AIで画像の理解と生成を同時に目指すVBVR‑Pro:画像や動画を「考える道具」として扱うための検証可能な実験環境を公開MMDiff:マルチモーダル大規模言語モデルの内部特徴を発見し操作する方法PhiZero:映像から学んだ「物理言語」で未来の動きを推論して動画を作る世界モデルClinFusion:2Dと3D画像を統合する視覚中心の医療向け多モーダルLLMRGB動画だけで3D空間を理解するVLM-IE3D:粗い3D知識と細かい3D構造を両方使う新しい枠組み全スライド病理画像と腫瘍微小環境を効率的に解析する小型基盤モデル「GigaPath‑Flash」と「GigaTIME‑Flash」VideoRAE:既存の動画基盤モデルの表現を圧縮して生成向け潜在空間にする手法限られた角度の乳房CTで測定を厳密に守り、不確かさを校正する新しい拡散再構成法論文教材から医療画像と言葉の高品質ペアを自動生成する「MedPMC」:11百万ペアを作成しモデル性能が向上SenseNova-U1.5:エンコーダー不要の「統合型」視覚AIで画像の理解と生成を同時に目指すVBVR‑Pro:画像や動画を「考える道具」として扱うための検証可能な実験環境を公開MMDiff:マルチモーダル大規模言語モデルの内部特徴を発見し操作する方法PhiZero:映像から学んだ「物理言語」で未来の動きを推論して動画を作る世界モデルClinFusion:2Dと3D画像を統合する視覚中心の医療向け多モーダルLLMRGB動画だけで3D空間を理解するVLM-IE3D:粗い3D知識と細かい3D構造を両方使う新しい枠組み全スライド病理画像と腫瘍微小環境を効率的に解析する小型基盤モデル「GigaPath‑Flash」と「GigaTIME‑Flash」VideoRAE:既存の動画基盤モデルの表現を圧縮して生成向け潜在空間にする手法限られた角度の乳房CTで測定を厳密に守り、不確かさを校正する新しい拡散再構成法論文教材から医療画像と言葉の高品質ペアを自動生成する「MedPMC」:11百万ペアを作成しモデル性能が向上

今日の記事

2026年9月14日月曜日
すべて人工知能機械学習自然言語処理コンピュータビジョンロボティクス暗号物理学数学
コンピュータビジョン注目

SenseNova-U1.5:エンコーダー不要の「統合型」視覚AIで画像の理解と生成を同時に目指す

研究チームはSenseNova-U1.5という新しいマルチモーダルモデルを発表しました。これは視覚情報の理解、推論、生成を一つの「ネイティブ」な枠組みで行うことを目指すモデルです。モデル本体は約80億パラメータの規模(8B)で、従来のような別個のエンコーダーや変分オートエンコーダ

2026年9月11日JA2分
記事全文を読む

最新の記事

人工知能
2026年8月27日

VBVR‑Pro:画像や動画を「考える道具」として扱うための検証可能な実験環境を公開

この論文は、画像や動画を単なる入力や出力ではなく、推論そのものの「媒体」として扱う研究を進めるための実験基盤、VBVR‑Proを導入します。VBVR‑Proは閉ループのテストベッドで、視覚生成を使った推論を学習可能にし、評価可能にし、最適化や制御がしやすい形にした点が特徴です。

JA
2分
人工知能
2026年8月11日

MMDiff:マルチモーダル大規模言語モデルの内部特徴を発見し操作する方法

研究の主題は、画像と言葉の両方を扱うマルチモーダル大規模言語モデル(MLLM)の内部で働く「特徴」を見つけ出し、操作できるようにすることです。著者らはMMDiffという枠組みを提案しました。これは隠れ層の表現を疎な成分に分解する「疎自己符号化器(Sparse Autoencode

JA
2分
コンピュータビジョン
2026年7月31日

PhiZero:映像から学んだ「物理言語」で未来の動きを推論して動画を作る世界モデル

この論文は、映像から「物理言語」と呼ぶコンパクトな離散表現を学び、その言語の上で未来の世界の動きを推論してから映像に戻す世界モデル、PhiZero を提案します。物理言語は映像に現れる状態の変化(たとえば物が落ちる、注ぐ動きが進む)を符号化したもので、まず動きのパターンを言語の列

JA
2分
広告
人工知能
2026年7月28日

ClinFusion:2Dと3D画像を統合する視覚中心の医療向け多モーダルLLM

この論文は、医療画像を中心に理解できる多モーダル大規模言語モデル(MLLM)「ClinFusion」を紹介します。研究者たちは、単にテキストを扱うだけでなく、X線やCT、MRIなどの2次元(2D)と3次元(3D)画像を統合して診断に役立つ出力を作ることを目指しました。彼らはモデル

JA
2分
人工知能
2026年7月24日

RGB動画だけで3D空間を理解するVLM-IE3D:粗い3D知識と細かい3D構造を両方使う新しい枠組み

この論文は、2D画像や動画から学ぶ視覚言語モデル(VLM)が、細かい3次元(3D)の空間理解や推論で苦戦する問題を扱います。著者らはRGB動画(カラー映像)だけを使い、粗い3Dの概観情報と細かい3D構造の両方をモデルに取り入れる新しい枠組み「VLM-IE3D」を提案しました。狙い

JA
2分
人工知能
2026年7月21日

全スライド病理画像と腫瘍微小環境を効率的に解析する小型基盤モデル「GigaPath‑Flash」と「GigaTIME‑Flash」

この論文は、がん病理画像(全スライド画像)を扱うための効率的な基盤モデルを紹介します。GigaPath‑Flashはギガピクセル級のスライド全体を文脈付きで表現するモデルです。GigaTIME‑Flashは日常のH&E染色画像から腫瘍の免疫微小環境に関わるタンパク質の空間分布を予

JA
2分
コンピュータビジョン
2026年7月16日

VideoRAE:既存の動画基盤モデルの表現を圧縮して生成向け潜在空間にする手法

この論文は、動画を生成するための良い「潜在表現」を作る方法を示します。研究者たちは、すでに高い動画理解能力を持つ動画基盤モデル(Video Foundation Models、VFM)の出力を凍結(学習させずに固定)したまま使い、その多層的な特徴を圧縮して生成に適した潜在表現を作

JA
2分
コンピュータビジョン
2026年7月15日

限られた角度の乳房CTで測定を厳密に守り、不確かさを校正する新しい拡散再構成法

この論文は、少数の低線量投影から体積画像を作るデジタル乳房トモシンセシス(DBT: digital breast tomosynthesis)で、観測データに「完全に一致」する画像を出しつつ、生成型の学習事前分布(拡散モデル)による不確かさを正しく評価する方法を示します。代表的な

JA
2分
機械学習
2026年7月9日

論文教材から医療画像と言葉の高品質ペアを自動生成する「MedPMC」:11百万ペアを作成しモデル性能が向上

要旨:研究チームは、公開されている医学文献(PubMed Central、PMC)を自動で処理して、医療用の画像と説明文の高品質なペアを大量に作る仕組み「MedPMC」を作りました。PMCの6.1百万記事を対象にして、11百万の医療画像–文章ペアを抽出しました。目的は、画像と言語

JA
2分
次の記事を見る