正しい報酬でも学習がうまくいかないことがある:解析解のあるブローカー–トレーダーゲームでPPOを調べる
この論文は、解析的に解かれた連続時間のブローカーとトレーダーのゲームに、強化学習(Proximal Policy Optimization=PPO)を置いて検証した研究です。目的は「理論的に正しい報酬」を与えればRLが既知の最適戦略を再現できるかを調べることと、解析解を出発点に環境変化後の調整ができるかを確かめることです。環境には情報を持つトレーダーと確率的な無情報フロー(顧客注文)が含まれます。ブローカーの取引速度をPPOが決め、解析的な応答ルールに従う「解析フィードバック」トレーダーとやり取りします。
研究者たちはまず、連続時間で定義されたブローカーの報酬を離散ステップの学習環境に対応させるために有限ステップ報酬を導出しました。導出した報酬は格子の細かさを変えて確認し、さらに一歩だけ進めたときの正確な恒等式で実装が正しいことを検証しています。実験では、PPOの方策(行動決定部)に対して、単純な全結合ニューラルネットワーク(PPO–FFNN)と、履歴を扱える長短期記憶(LSTM)を使ったもの(PPO–LSTM)を比較しました。観測できる変数群には価格や在庫、価格影響の状態、無情報フローなどが含まれます。
結果は状況によって大きく異なりました。無情報フローがない場合は、検証データで選んだPPO–FFNNが解析解に近い行動を学習できました。一方で、無情報フローが確率的に入る場合は、PPO–FFNNもPPO–LSTMも解析解とかなりずれた行動を出しました。興味深いのは、教師あり学習でこれらのネットワークが正しい行動を表現できることが確認できたにもかかわらず、PPO学習ではうまくいかなかった点です。モンテカルロによる診断では、PPOの「クリティック」(価値を推定して行動を評価する部分)が近い行動を正しく評価・序列付けできておらず、それが学習失敗の一因とされています。報酬を形を変えて学習を助ける「ポテンシャルに基づく報酬整形」も、信頼できる改善をもたらしませんでした。
部分観測(インフォームドトレーダーの在庫や信号が見えない)下では、研究者は簡易な確信同等(certainty-equivalent)コントローラーを作り、観測履歴から隠れ変数を推定して応答させました。この因果的推定に基づくコントローラーは解析解に近い行動と高い報酬を維持しましたが、PPOはより大きな誤差と低い報酬を示しました。つまり、隠れた情報がある設定では、単純な推定に基づく手法の方がPPOより堅牢だったという点が示されています。
最後に、解析的方策を固定し(凍結し)、実行コストが変わった後にPPOでその方策を調整する実験を行いました。実行コストを半分にすると、PPOは再現性のある改善を学習し、変化後の解析解とのギャップの2.22%を埋めることができました。研究者はこれを受けて、解析解は単に比較対象として有用なだけでなく、環境変化時の初期方策としても出発点になると結論づけています。ただし、重要な制約として、無情報ノイズや部分観測のある現実的な状況ではPPOのクリティック評価や報酬整形が十分でなく、学習が不安定になることが示されました。また、方策調整で得られた改善は小さく(この実験では2.22%)、万能の解ではない点にも注意が必要です。