すべての人に一次情報を
研究チームはSenseNova-U1.5という新しいマルチモーダルモデルを発表しました。これは視覚情報の理解、推論、生成を一つの「ネイティブ」な枠組みで行うことを目指すモデルです。モデル本体は約80億パラメータの規模(8B)で、従来のような別個のエンコーダーや変分オートエンコーダ
この論文は、画像や動画を単なる入力や出力ではなく、推論そのものの「媒体」として扱う研究を進めるための実験基盤、VBVR‑Proを導入します。VBVR‑Proは閉ループのテストベッドで、視覚生成を使った推論を学習可能にし、評価可能にし、最適化や制御がしやすい形にした点が特徴です。
研究の主題は、画像と言葉の両方を扱うマルチモーダル大規模言語モデル(MLLM)の内部で働く「特徴」を見つけ出し、操作できるようにすることです。著者らはMMDiffという枠組みを提案しました。これは隠れ層の表現を疎な成分に分解する「疎自己符号化器(Sparse Autoencode
この論文は、映像から「物理言語」と呼ぶコンパクトな離散表現を学び、その言語の上で未来の世界の動きを推論してから映像に戻す世界モデル、PhiZero を提案します。物理言語は映像に現れる状態の変化(たとえば物が落ちる、注ぐ動きが進む)を符号化したもので、まず動きのパターンを言語の列
この論文は、医療画像を中心に理解できる多モーダル大規模言語モデル(MLLM)「ClinFusion」を紹介します。研究者たちは、単にテキストを扱うだけでなく、X線やCT、MRIなどの2次元(2D)と3次元(3D)画像を統合して診断に役立つ出力を作ることを目指しました。彼らはモデル
この論文は、2D画像や動画から学ぶ視覚言語モデル(VLM)が、細かい3次元(3D)の空間理解や推論で苦戦する問題を扱います。著者らはRGB動画(カラー映像)だけを使い、粗い3Dの概観情報と細かい3D構造の両方をモデルに取り入れる新しい枠組み「VLM-IE3D」を提案しました。狙い
この論文は、がん病理画像(全スライド画像)を扱うための効率的な基盤モデルを紹介します。GigaPath‑Flashはギガピクセル級のスライド全体を文脈付きで表現するモデルです。GigaTIME‑Flashは日常のH&E染色画像から腫瘍の免疫微小環境に関わるタンパク質の空間分布を予
この論文は、動画を生成するための良い「潜在表現」を作る方法を示します。研究者たちは、すでに高い動画理解能力を持つ動画基盤モデル(Video Foundation Models、VFM)の出力を凍結(学習させずに固定)したまま使い、その多層的な特徴を圧縮して生成に適した潜在表現を作
この論文は、少数の低線量投影から体積画像を作るデジタル乳房トモシンセシス(DBT: digital breast tomosynthesis)で、観測データに「完全に一致」する画像を出しつつ、生成型の学習事前分布(拡散モデル)による不確かさを正しく評価する方法を示します。代表的な
要旨:研究チームは、公開されている医学文献(PubMed Central、PMC)を自動で処理して、医療用の画像と説明文の高品質なペアを大量に作る仕組み「MedPMC」を作りました。PMCの6.1百万記事を対象にして、11百万の医療画像–文章ペアを抽出しました。目的は、画像と言語