すべての人に一次情報を
この論文は、散らかった屋内空間をヒューマノイドロボットが安全に移動する方法を扱います。従来の研究は床面の2次元経路計画に注目しがちですが、狭い場所や障害物の多い場所では腕の位置、胴体の角度、歩き方など全身の連携が必要です。著者らはこうした「全身」適応を言葉で指示された移動タスクに
この論文は、ロボットが「触れること」の結果を予測して扱えるようにする基盤モデル、Facet-0を紹介します。実世界の組み立て作業はサブミリ(1ミリの1000分の1)単位の空間精度と、部品と接触したときの柔軟な振る舞いが必要です。研究者たちは、行動がどのような力やトルク(wrenc
この論文は、画像や動画を単なる入力や出力ではなく、推論そのものの「媒体」として扱う研究を進めるための実験基盤、VBVR‑Proを導入します。VBVR‑Proは閉ループのテストベッドで、視覚生成を使った推論を学習可能にし、評価可能にし、最適化や制御がしやすい形にした点が特徴です。
この論文は、腹腔鏡(ラパロスコピー)手術での深さの見え方を一枚の画像から推定する手法を示します。研究者は、投影器と内視鏡を小さく組み合わせ、同期の必要ない単発(single‑shot)の構造光方式と機械学習を組み合わせて、リアルタイムに近い速度で深度を出せることを目指しました。正
この論文は「LLM-as-a-Verifier」という新しい検証フレームワークを提案しています。ここで言う検証とは、提示された解答や行動列(トラジェクトリ)が正しいかを判断することです。研究者らは、大規模言語モデル(LLM)の追加学習をせずに、モデルが出す各トークンの確率(ロジッ
この論文は、不確かさのある非線形システムやニューラルネットワークで表現される力学に対して、実時間で動作し、かつ制約を満たすことを保証する最適制御を目指しています。研究の中心にあるのは「線形化誤差境界(LEB: linearization error bound)」と呼ばれる考え方
この論文は、視覚と言語から行動を作るロボット(Vision–Language–Action、VLA)の安全性を系統的に評価するための新しいベンチマーク「LIBERO‑Safety」を紹介します。研究者たちは、衝突や誤った命令の実行といった現実で危険になりうる状況を自動で作り出し、
この論文は、言葉で与えた指示をその場の複数カメラ画像から3次元の実行可能な計画に直して、学習せずに(ゼロショットで)長い手先操作を行う仕組みを示します。ゼロショットとは、新しい物体やタスクに対して追加学習なしで動作することを指します。研究者たちは、端から端まで学習するポリシーを作
この論文は、完全なモデルがない非線形プロセスを運転しながら、安全性を保って未知の振る舞いを学習する方法を示します。研究者たちは、プロセスの「おおまかな線形近似」が分かっているだけという現実的な状況を想定しました。未知の非線形部分はオンラインで学習するGaussian proces
研究の主題は日常物体の素材識別です。見た目が似ているガラスとプラスチックのような物は、光学カメラだけでは誤認されやすい問題があります。著者らは、視覚と言語を結び付けたAI(VLM: ビジョン・ランゲージ・モデル)とミリ波レーダーの物理情報を組み合わせる新しい枠組み「VLMater