すべての人に一次情報を
この論文は「LLM-as-a-Verifier」という新しい検証フレームワークを提案しています。ここで言う検証とは、提示された解答や行動列(トラジェクトリ)が正しいかを判断することです。研究者らは、大規模言語モデル(LLM)の追加学習をせずに、モデルが出す各トークンの確率(ロジッ
この論文は、不確かさのある非線形システムやニューラルネットワークで表現される力学に対して、実時間で動作し、かつ制約を満たすことを保証する最適制御を目指しています。研究の中心にあるのは「線形化誤差境界(LEB: linearization error bound)」と呼ばれる考え方
この論文は、視覚と言語から行動を作るロボット(Vision–Language–Action、VLA)の安全性を系統的に評価するための新しいベンチマーク「LIBERO‑Safety」を紹介します。研究者たちは、衝突や誤った命令の実行といった現実で危険になりうる状況を自動で作り出し、
この論文は、言葉で与えた指示をその場の複数カメラ画像から3次元の実行可能な計画に直して、学習せずに(ゼロショットで)長い手先操作を行う仕組みを示します。ゼロショットとは、新しい物体やタスクに対して追加学習なしで動作することを指します。研究者たちは、端から端まで学習するポリシーを作
この論文は、完全なモデルがない非線形プロセスを運転しながら、安全性を保って未知の振る舞いを学習する方法を示します。研究者たちは、プロセスの「おおまかな線形近似」が分かっているだけという現実的な状況を想定しました。未知の非線形部分はオンラインで学習するGaussian proces
研究の主題は日常物体の素材識別です。見た目が似ているガラスとプラスチックのような物は、光学カメラだけでは誤認されやすい問題があります。著者らは、視覚と言語を結び付けたAI(VLM: ビジョン・ランゲージ・モデル)とミリ波レーダーの物理情報を組み合わせる新しい枠組み「VLMater
この論文は、動画から将来の「潜在(ラテント)表現」を予測する世界モデルを、視覚と言語を結びつけた大規模モデル(Vision–Language Model、VLM)で補強する方法を示します。提案手法の名前はThinkJEPAです。短い観測窓で密にフレームを予測する従来の潜在世界モデ