RePlay:事前録音したせりふを即座に再生する低遅延の音声対話システム
この論文は、あらかじめ録音された台詞(せりふ)を低遅延で再生することで、内容としゃべり方の厳密な制御が必要な音声対話に応える手法を示します。研究者たちは、発話を最後まで聞いてから文字起こしと生成を行う従来の連鎖型(カスケード)システムや、低遅延だが生成により内容が変わる全二重モデルの良いところを組み合わせようとしました。結果として生まれたのがRePlayで、システムは「これから何を言うか」を内部の隠れ状態(モデルの内部表現)から予測して、対応する録音を取り出して再生します。これにより、録音された特定の演技をそのまま使いながら反応を速くできます。
技術の核は既存のPersonaPlexという全体モデルを部分的に使う点です。PersonaPlexは音声を連続で処理し、特定のトークン(研究では<EPAD>と呼ぶ)で応答開始を示します。研究チームは「いつ」「どの層」で次の応答が内部に表れているかを調べるプロービングを行い、応答が取り出せる最も早い層を特定しました。具体的には、トークンが入力として与えられた直後の層15(32層中)で応答の情報が明瞭になったため、最初の16層だけを残して後続の生成処理を捨て、代わりに「いつ応答を始めるか」を判定するターン検出ヘッドと、「どの録音を再生するか」を決める検索(リトリーバル)ヘッドを付けました。結果、音声の自動文字起こし(ASR: Automatic Speech Recognition)や音声合成(TTS)を実行せずに、録音の直接再生で応答できます。
評価は主に合成データで行われました。まず100人分のキャラクターと計約29,225行の台詞を用意した大規模な合成対話データセット(D1)を作り学習しました。対象シナリオとしては「面接」の設定で、キャラクター“Nobu”のために300行を作ったD2で微調整とテストを行いました。シミュレーション結果では、RePlayの中央値遅延は383ミリ秒で、同程度の会話品質を示したASR+大規模言語モデル(LLM)を使うカスケード型より3~7倍速いと報告しています。一方で「ちょうどその行を正確に選べる確率」は下がるというトレードオフがあります。実ユーザースタディでは、参加者の63%がRePlayを高速な小型LLMカスケード(12%支持)より好むと答え(p = 0.008)、より強力だが遅いカスケードとは46%対21%で有意ではない差を示しました。
このアプローチが重要なのは、ゲームや案内、カスタマーサービスなどで「演技や文言を厳密に保ちたい」用途に低遅延で対応できる点です。新しい台詞を追加する際は、その台詞の埋め込み(ベクトル表現)を用意すれば再学習なしで拡張できるため、実装面でも扱いやすい設計です。さらに、内部表現の早期読み出しによって計算量を半分にできた点も実運用での利点です。
ただし重要な制約もあります。評価の多くは合成データに基づいており、実世界の雑音や多様な話し方での一般化は慎重に判断すべきです。正確に台詞を一致させる能力はカスケード方式に比べ低くなる場合があるため、応答の完全な一致が不可欠な用途では問題になる可能性があります。また、ユーザースタディでは強力な遅いカスケードに対する有意な優位性は示されず、実際の採用では速度と正確さのどちらを優先するかで評価が分かれます。研究チームは実データ混入も試みたが効果は見られなかったと述べており、実運用での堅牢性は今後の課題です。