TrackEverything:長い動画で画面上のすべての点を追跡する3D表現の仕組み
この論文は、動画中の「すべての見えている点」を長時間にわたって追跡する手法を示します。従来の点追跡は、少数の点を長く追うか、すべての点を短い区間だけ追うかのどちらかに限られていました。TrackEverything は、映像を世界座標に固定された持続的な3Dシーントラックとして表現することで、このトレードオフを破ることを目指します。
研究者たちの基本的な洞察は単純です。動画は2Dの映像であるが、その背後には3次元の実世界がある、という点です。TrackEverything はこの考えに基づき、処理の負荷を動画の長さに結びつけず、代わりに現実の物理的な形状の「量」に結びつけます。つまり、同じ場所や表面が何度も観測されても無駄に計算や記憶を増やさないように設計されています。
手法は三つの主要な工夫で成り立っています。第一に、ボクセル化(3次元空間を小さな立方体に分けること)を使った重複除去を、スライディングウィンドウ(時間を少しずつずらして処理する区間)境界で行い、同じ位置のトラックをまとめて重複蓄積を防ぎます。第二に、追跡を二段階に分けます。まず終点を予測し、その点が静止か動いているかを判断する「エンドポイントリファイナー」を使い、次に動いている点だけに対して軽量な「軌跡リファイナー」で詳細な経路を復元します。第三に、3D WAFT と呼ぶ仕組みで、メモリを大量に消費する4次元(空間×時間)の相関表現を使う代わりに、シーン点群(3Dの点の集まり)から効率よく特徴を取り出す方法を採用しています。
成果として、著者らは TrackEverything が「1000フレームを超える動画でも、40 GB のGPUメモリ内で見えているすべての点を追跡できる」と報告しています。また、TAPVid-3D というデータセット上の短いクリップでは、既存のオープンソースの全フレーム密な3Dトラッカーを大きく上回り、論文で使われた評価指標 APD(論文で用いられた評価指標)で20%以上の改善を示したとしています。長いシーケンスでは、追跡点が桁違いに多いにもかかわらず、最先端のスパース(まばら)トラッカーと競争力のある結果を出したとしています。
注意すべき点もあります。上の性能は著者らの報告に基づくもので、比較は主に TAPVid-3D 上の結果に関するものです。論文の要旨には他のデータセットでの一般化性や具体的な失敗例、実時間性能や複雑な実世界条件での堅牢性についての詳細は記載されていません。TrackEverything の設計は長時間を効率的に扱うことを重視していますが、実際の利用や他の評価指標でどのように振る舞うかは、本文の詳細や追加の検証を見て判断する必要があります。