「設定ファイルとしてのプロンプト」:大規模調査で明らかになったLLMのシステムプロンプトの中身
この論文は、公開されたり流出したりした「システムプロンプト」が実際に何を書いているかを大規模に調べた研究です。システムプロンプトとは、利用者からの入力が来る前に言語モデルに与えられる常設の指示文で、アシスタントの役割やツールの使い方、出力形式、拒否基準などを固定します。著者たちはこれらの文書を「価値観の告白」ではなく設定や運用仕様に近いものとして扱うべきだと結論づけています。調査は、主張の裏づけとなる量的な発見に基づいています。
研究チームは四つのコミュニティ収集リポジトリを結合し、合計407ファイル(62ベンダー分)を解析しました。元データはCL4R1T4S(66ファイル)、System‑Prompts(30)、system‑prompts‑and‑models‑of‑ai‑tools(112)、system_prompts_leaks(231)という収集元から2026年6月17日から7月11日に集められています。重複検出で29の近似重複クラスタ(66ファイル)を特定し、実質的に370件の一意な文書が得られました。これらはチャット補助やコーディングエージェント、自律エージェントなど六つの類型に手作業で分類されています。
分析の結果、プロンプトの語彙は「運用上の指示」に偏っていました。単純な段落単位の分類器で分類された語のうち約58%がツール使用や手順(tool/protocol)に割り当てられた一方、安全方針は約5%にとどまりました。もっとも厳格な行単位のルールでは、ツールの使い方やファイルの安全管理を有害発言の制限よりも約11倍重視する記述が多いことが示されました。また、文字どおりのテキスト転用(他社からのそのままの流用)はごく一部のベンダー間に集中しており、文書構造や設計の収束は必ずしも文言のコピーを伴わないことが分かりました。
さらに、プロンプトには保守負債(メンテナンスデット)が見られました。バージョンチェーンの差分を調べると、リリースごとに数千語単位の入れ替えが起きる場合があり、古い参照や矛盾する指示の蓄積が「プロンプトの腐敗(prompt rot)」を生むリスクが指摘されます。著者はAnthropicの公開されたプロンプト群(2024‑07‑12〜2026‑05‑28)を検証用の確定日付データとして用い、流出文書群との比較にも利用しました。類似性解析にはnグラムのJaccardや単語埋め込みなど、ソフトウェアのクローン検出に近い手法を採用しています。
重要な注意点も明示されています。調査対象の多くは抽出や再構成によって得られた「流出」文書であり、元のベンダーの公式方針や実際に運用されている内容と完全に一致するかは検証できません。分類に使った正規表現や段落分類器は意図的に単純で可監査ですが、そのため指標は過小評価や過大評価の両方になり得るので「方向性を示す」値として扱うべきだとしています。ラベル付けは単独のコーダーによる手作業であり、これも結果の弱点として論文で議論されています。こうした前提を踏まえ、著者は流出プロンプトを「企業の良心を表す告白」ではなく「設定ファイルに近い運用仕様」とみなすことを提案し、流用や腐敗をソフトウェア工学とサプライチェーンの問題として扱うべきだと結んでいます。