DreamStream:政策(ポリシー)評価に重点を置いた生成型クローズドループ運転シミュレータ
この論文は、自動運転の「エンドツーエンド(E2E)」ポリシーを正しく評価するために、単に写真のように見えるだけでなく、ポリシーが意思決定に使う場面の特徴を保つ観測画像を出すシミュレータを作ることを目指しています。既存のプラットフォームは実世界との見た目の差(sim-to-realギャップ)によってポリシーの認知を乱し、閉ループでの判断力を正しく評価できない問題があります。DreamStreamはこの問題に対処するための生成型クローズドループシミュレータです。
DreamStreamは、シミュレータに基づいて学習された自己回帰型の動画モデルを使います。研究者たちは大規模に事前学習された動画モデルを蒸留(より小さく使いやすくすること)し、交通の配置(レイアウト)情報で誘導することで、見た目を変えながらもポリシーに重要な特徴、例えば道路や車両の配置の構造や動く物体の時間的一貫性を保てるようにしました。要するに、映像の「見た目」は変えても、ポリシーが判断に使う場面の核心は壊さないように設計されています。
また研究者たちは、従来の画像の見た目評価指標(たとえばFID:Fréchet Inception Distance)が、ポリシーにとって重要な特徴の保存状態を正しく評価できないことを観察しました。そこで新しい指標FDπ(Fréchet distance over scene-context features from public end-to-end policies)を導入しました。これは公開されているE2Eポリシーの内部表現(シーン文脈に関する特徴)を使って、シミュレーションと実世界の差を分布の距離で測るものです。FDπの下で、DreamStreamは既存の最良のクローズドループシミュレータと比べて、nuScenesデータセットで1.6倍、NAVSIMで4.7倍の改善を示し、ポリシーの感知可能性への撹乱が最も小さいことが確認されました。
さらに、研究チームはNavhard-CLというベンチマークを作りました。これは元々反応的でない実世界ベンチマークNAVSIMを、敵対的な運転振る舞いや天候変化を加えた対話的(インタラクティブな)テスト環境に変換するものです。このベンチマークにより、スコアの偏り(scorer bias)や回復行動の欠如など、従来のクローズドループ評価では見落とされがちなポリシーの多くの失敗モードが明らかになりました。コードとデータは公開されています(https://github.com/VAIL-UCLA/DreamStream)。
注意点として、論文はシミュレータが実世界を完全に再現するわけではないことを前提にしています。FDπはポリシー由来の特徴に基づく新しい指標ですが、その評価も用いるポリシーや表現に依存します。また、生成モデルは見た目を変える過程で予期しない変化を生む可能性があります。論文自体にも制限事項の議論があり、シミュレーション結果を実車の挙動や安全性の最終判断に直ちに置き換えるには慎重さが必要だと考えられます。