映像符号化を人間の見え方で最適化:ヘッセ行列の確率推定でブロック単位近似を実現
この論文は、従来の誤差二乗和(SSE)ではなく、人間の見え方に近い評価指標で符号化を最適化する方法を示します。フルリファレンス画像品質評価(FR-IQA:参照画像と比較して品質を測る指標)はMS-SSIMやLPIPSなど、人間の知覚に合いやすい一方で、通常は全画面を必要としブロックごとの符号化決定には使いにくい問題があります。本研究はその障害を取り除き、符号器の「ループ内(in-loop)」最適化に使える近似法を提案します。
研究者らは、任意の差分可能なFR-IQA指標を入力依存の二次歪み(IDQD: input-dependent quadratic distortion)で近似しました。具体的には、指標を入力まわりで二次展開して得られるヘッセ行列(関数の二階微分を並べた行列)を歪みの曲率として使います。しかしヘッセ行列は巨大で扱いにくいため、1) ブロックごとの対角ブロックだけを残す近似(ブロック対角)、2) 完全にピクセル単位の対角のみを残す近似、の二種類を提案しました。これらの行列を直接計算する代わりに、自動微分を使ったヘッセ行列とベクトルの積(Hessian-vector product)をランダムプローブで確率的に推定します。さらに、LPIPSやDISTSのように残差の二乗ノルムで表せる指標ではガウス・ニュートン近似を用い、分散の小さい推定を行います。
仕組みの大まかな直観はこうです。評価指標を入力まわりで二次関数に近似すると、「曲率」が各画素や近傍の重要度を示します。これを局所化してブロック単位にすると、従来のブロック単位のレート歪み最適化(RDO)がそのまま使えるようになります。局所化は「画素は主に近傍と結びつく」という仮定に依存します。ヘッセの大きさはランダム探査によって確率的に推定されるため、実装は符号化器側だけを変え、デコーダ側は変更しません。符号化時の品質と従来のPSNR(ピーク信号対雑音比)とのトレードオフを制御する正則化項も導入しています。
実験はVVC(次世代映像コーデック)のイントラ符号化で行われ、評価はKodakとCLICのデータセット、および五種類の指標(例:SSIM, MS-SSIM, LPIPS, DISTS, Wasserstein Distortion)で実施されました。ブロック対角推定器は、対象とする指標に対してKodakでBD率(同一品質でのビットレート削減)を15.5〜23.6%節約、CLICで14.2〜36.7%節約しました。論文全体ではIDQD-RDOがターゲット指標に対して14.2〜36.7%のBD率改善を報告しています。既存手法のPerceptQPAや、学習済みコーデックからビット割当を移す方法に比べても、最適化した指標上で上回る結果を示しました。デコーダの複雑さは変わらず、エンコーダ側の実行時間はおよそ10〜30%増加しました。
重要な注意点もあります。IDQDは入力まわりの二次展開(高レートで有効という仮定)に基づきます。ヘッセ行列の局所化(ブロック対角化や対角化)は「遠く離れた画素の結びつきは弱い」という仮定に依存するため、指標や画面内容によって精度は異なります。さらに、ReLUを含むネットワーク由来の指標は元々微分可能性の要件を満たさないため、平滑化が必要です。確率的推定には分散があり、対角推定はブロック推定より効果が小さい傾向が報告されています。実験はVVCのイントラ符号化と限られたデータセット・指標での結果なので、他の符号化条件や実運用での一般化には追加検証が必要です。
まとめると、この研究は「人間の見え方に合わせた」評価指標を符号化器の内部で使えるようにした実用的な手法を示します。大きな行列を確率的に推定して局所化することで、デコーダを変えずに符号化品質を指標に合わせて改善できます。一方で、近似と推定の仮定や計算コスト増加といった現実的な制約も明確に示されており、さらなる検証と改良が望まれます。