KaliBench:Kali Linuxのコマンド生成を厳密に評価する新しいベンチマーク
研究チームは、自然言語の指示を正確なコマンドに変換できるかを測るためのベンチマーク「KaliBench」を作りました。KaliBenchはKali Linuxの実際のセキュリティツールを対象にし、合計8,504組の「問い(自然言語)」と「正解コマンド」のペアを収めています。対象は1,642のツールにまたがり、23の機能カテゴリーと5つのセキュリティ段階で整理されています。目的は「生成されたコマンドがちょっとした構文ミスで失敗する」ような現実の問題を正確に評価することです。
構築は一連の手順で行われました。まずKaliの公式ドキュメント(2,372ツール分)からツール名やフラグ(オプション)・別名を抽出し、それを手がかりにQwen3-Maxという大規模言語モデルを使って多くの問い–コマンド候補を生成しました。候補はさらに検証用の段階を経ます。検証は(1)言語モデルによる自動チェック、(2)サンドボックス化した端末での実行テスト、(3)人手による精査、という複数の段階で行われ、最終的に重複を除いて5,000件の評価サンプルと3,504件の訓練サンプルに分かれています。評価は別名に対応した解析や、ツール選択と引数(フラグや位置引数)の個別スコア付けなど、細かい点まで確かめられるようになっています。
評価は「unrestricted(制約なし)」「restricted(制限あり)」「hinted(ツールの手がかりあり)」という3つのモードで行われます。重要な技術の一つが「ランタイム不要の検証可能報酬」です。これはコマンドの構造が決定的であることを利用し、実際にコマンドを実行しなくても正しさを検証して報酬信号に変えられる仕組みです。こうした報酬を使うことで、実行環境を用意しなくても強化学習的な後学習が可能になります。
主な結果として、一般公開されている重み(open-weight)を持つモデル24構成を評価したところ、制約なしの設定で「完全に正しいコマンド」を生成できた割合はどのモデルも42%を超えませんでした。研究では特に「引数の構成(どのフラグにどの値を与えるか)」が主要な障害であると指摘しています。一方で、訓練データを使った教師付き微調整(SFT)と、KaliBench由来の検証可能報酬による強化学習(RLVR)を組み合わせると、8Bパラメータのモデルの性能が向上し、非常に大きな685BのMixture-of-Expertsモデルと同等の成績に近づけられたと報告しています。
注意点と限界も明確です。まず言語モデルの「幻覚(hallucination)」は依然として問題で、ドキュメントにない誤ったフラグや使い方を生成することがあります。CLI(コマンドライン)は小さな誤りでも実行不能になるため、高精度が求められます。データは公式ドキュメントに基づいているため、現場での慣習や非公式なラッパーには対応していない場合があります。最後に、ベンチマークはコマンド生成の評価に特化しており、実際の攻撃や防御全体の自動化に直ちに適用可能だと保証するものではありません。それでもKaliBenchは、コマンドレベルでの正確さを厳密に測る初の試みとして、セキュリティ向けモデルの実用化に向けた重要な評価基盤を提供します。