観察データだけで感度解析を行う新しい方法—MM‑GSA:メタモデルを使って入力の重要性を測る
この論文は、既に収集された観察データしか使えない状況で、どの入力が出力にどれだけ影響するかを評価する方法を示します。従来のグローバル感度解析(Global Sensitivity Analysis, GSA)は、モデルを任意の入力で何度も実行できることを前提にしていました。現実にはモデルや実験を自由に繰り返せないことが多いため、著者らは観察データだけで使える手法「MM‑GSA(メタモデルベースのGSA)」を提案します。
MM‑GSAの考え方は単純です。まず、監視学習(スーパー�バイズド・ラーニング)で入力から出力への「系統的な関係」を近似するメタモデルを作ります。次に、そのメタモデルを使って感度指標を計算します。つまり、直接モデルを好きな入力で評価できなくても、観察データから学んだ近似モデルを通じて全体的な入力の影響を評価する、という流れです。
論文で扱う感度の見方は二つあります。1つ目は「一次ソボル指数(Sobol' index)」に基づくもので、ある入力が系統的な応答の変動にどれだけ寄与するかを分散の割合で表します。簡単に言えば、その入力を知ることで応答の予測がどれだけ安定するかを計る指標です。2つ目は著者が新たに提案する「構造的指標(trigger‑based structural index)」で、これはある入力が使えるかどうか(変数が利用可能かどうか)によって予測性能がどれだけ変わるかを、代わりに使う予測子の組み合わせを比べて評価します。この二つは互いに補完的で、前者は応答の変動への寄与、後者は実際にその変数があったときの予測上の利点を示します。
理論的には、著者らは両方の推定量について「一致性(サンプルが増えれば真の値に近づく)」を示しています。また、入力が互いに独立である場合には構造的指標に変数選択の性質があることも示されています。実際の振る舞いはモンテカルロ実験と米国の健康調査(NHANES)データを使った応用で示しており、有限サンプルで両指標が補完的な情報を与えることを確認しています。
注意点もあります。第一に、MM‑GSAは観察データから作ったメタモデルに依存します。メタモデルの性能やサンプルサイズが不十分だと、感度推定にも誤差が入ります。第二に、構造的指標の変数選択性は入力変数が互いに独立であるという条件の下で示された性質です。入力に強い依存関係がある場合の振る舞いは慎重に扱う必要があります。最後に、観察データの枠内で学習する手法なので、因果関係の発見やモデル外の入力配置での一般化を自動的に保証するものではありません。論文はこの手法が与えられたデータから得られる感度情報を補完的に提供する、と位置づけています。