すべての人に一次情報を
この論文は、映像から「物理言語」と呼ぶコンパクトな離散表現を学び、その言語の上で未来の世界の動きを推論してから映像に戻す世界モデル、PhiZero を提案します。物理言語は映像に現れる状態の変化(たとえば物が落ちる、注ぐ動きが進む)を符号化したもので、まず動きのパターンを言語の列
この論文は、医療画像を中心に理解できる多モーダル大規模言語モデル(MLLM)「ClinFusion」を紹介します。研究者たちは、単にテキストを扱うだけでなく、X線やCT、MRIなどの2次元(2D)と3次元(3D)画像を統合して診断に役立つ出力を作ることを目指しました。彼らはモデル
この論文は、2D画像や動画から学ぶ視覚言語モデル(VLM)が、細かい3次元(3D)の空間理解や推論で苦戦する問題を扱います。著者らはRGB動画(カラー映像)だけを使い、粗い3Dの概観情報と細かい3D構造の両方をモデルに取り入れる新しい枠組み「VLM-IE3D」を提案しました。狙い
この論文は、がん病理画像(全スライド画像)を扱うための効率的な基盤モデルを紹介します。GigaPath‑Flashはギガピクセル級のスライド全体を文脈付きで表現するモデルです。GigaTIME‑Flashは日常のH&E染色画像から腫瘍の免疫微小環境に関わるタンパク質の空間分布を予
この論文は、動画を生成するための良い「潜在表現」を作る方法を示します。研究者たちは、すでに高い動画理解能力を持つ動画基盤モデル(Video Foundation Models、VFM)の出力を凍結(学習させずに固定)したまま使い、その多層的な特徴を圧縮して生成に適した潜在表現を作
この論文は、少数の低線量投影から体積画像を作るデジタル乳房トモシンセシス(DBT: digital breast tomosynthesis)で、観測データに「完全に一致」する画像を出しつつ、生成型の学習事前分布(拡散モデル)による不確かさを正しく評価する方法を示します。代表的な
要旨:研究チームは、公開されている医学文献(PubMed Central、PMC)を自動で処理して、医療用の画像と説明文の高品質なペアを大量に作る仕組み「MedPMC」を作りました。PMCの6.1百万記事を対象にして、11百万の医療画像–文章ペアを抽出しました。目的は、画像と言語
この論文は、コンピュータビジョンの多彩な作業をひとつの「生成」問題としてまとめる考えを提示します。研究者たちは、テキストと画像の両方を扱える統一モデルに対して、自然言語の指示と必要なら視覚プロンプトを与えることで、出力をテキスト、画像、あるいはその混合にして返す仕組みを作りました
この論文は、人工知能(AI)が医用画像で高精度を示しても、実臨床では患者層や撮像手順の違いで性能が変わる問題を明らかにするための研究です。研究者たちは、その差を系統的に測る大規模な公開ベンチマークを作りました。主な着目点は、がんの検出と位置特定の性能がどのように偏るかです。 研究
この論文は、音声や音楽などの信号に対して「理想的な時周波数表現」を高解像度で推定する新しいニューラル手法を紹介します。理想的な時周波数表現(Ideal Time‑Frequency Representations, ITFR)とは、スペクトログラムのような周波数情報や、テンポや拍