局所化コンフォーマル予測の有限サンプル保証——実際に得られる予測領域の条件付き精度と長さを同時に抑える理論
何が書かれているか。コンフォーマル予測は任意の黒箱モデルに対して有限サンプルでの周辺的(平均的)カバレッジ保証を与えます。しかし平均的な保証だけでは、ある入力付近で系統的に予測が外れることがあります。ランダムに局所化したコンフォーマル予測(Randomly Localized Conformal Prediction, RLCP)は、テスト点の近くで較正(キャリブレーション)することでこの問題に対処します。本稿は,RLCPで実際に得られる局所予測集合について,条件付きの妥当性(カバレッジ誤差)とオラクル(理想的な)領域に対する長さ誤差を有限サンプルで同時に高確率に抑える保証を与えるものです。
何をしたか。著者らはまずスコア(非適合度)の関数が固定されている場合を扱い,条件付きスコアの累積分布関数(CDF)がホルダー(Hölder)連続であることと,局所解析で標準的に仮定されるデザイン密度やカーネルの条件の下で,高確率の一様境界を示しました。境界は局所化帯域幅hと較正サンプルサイズnに応じて分解されます。主要な誤差成分は,入力点と局所混合との不一致に由来する局所化バイアスでO(h^β)(βはホルダーの滑らかさ)と表されます。一方で較正誤差は有効な局所較正サンプルサイズに依存して減少します。有効サンプルサイズは概ね n·p_min·h^d に比例し,ここでp_minは局所デザイン密度の下限,dは説明変数の次元です。バイアスと較正誤差の釣り合いを取ると,通常の非パラメトリック率 n^{-β/(2β+d)}(対数因子を含む)が復元されることが示されます。これらの境界は,局所化の中心となる実現値(auxiliary centre)を条件とした上で,その中心の周りの近傍 B(˜x,h) に対して同時に成り立ちます。
学習されたスコアの場合。スコアを独立な訓練データで学習する設定も扱います。とくに学習スコアが「ピボタル」(閾値が全ての入力で同じになる性質)を狙う場合(例:conformalized quantile regression=コンフォーマライズド分位回帰など)、局所化バイアスの項が消えます。その場合,誤差は較正誤差とスコア推定誤差の和に分解されます。推定誤差は局所近傍で平均化された形で閾値比較に線形に影響するので,スコア学習が改善されれば局所的な保証も改善します。
なぜ重要か。これまでの理論は周辺的な保証や平均的な分解を与えることが中心でしたが,実際にユーザーが受け取る「実現された」局所予測集合(実際の較正サンプルと局所中心に基づく集合)に対する有限サンプルの一様保証を与える点が本研究の貢献です。帯域幅hの選択に伴うバイアス–分散(ここでは較正サンプルの有効サイズ)トレードオフが明確になります。実務上は,局所を小さくして精度を上げると較正に使えるデータが減り,逆に大きくするとバイアスが増える,という直感が理論的に裏付けられます。数値実験もこのトレードオフや学習スコアの誤差の線形伝播を示しています。
重要な注意点。結果は追加の条件に依存します。具体的には,条件付きスコア分布のホルダー連続性,局所的なデザイン密度の下限,カーネルと設計の通常条件などが必要です。また,完全に分布に依存しない「点ごとの」条件付きカバレッジを有限サンプルで達成すること自体は不可能であることが既知です。本稿の保証はRLCPという手法に特化しています。さらに,境界は実現された局所中心と較正サンプルを条件にした「サンプル特有の」高確率事象の下での一様性を与えるもので,無条件に既存の結果より常に速い率を示すものではなく,Minらの最近の仕事と補完的な関係にあります。最後に,境界が成り立つためには帯域幅や較正サイズが論文中で示される許容域を満たす必要があります。