Motif‑Vocab:転写因子の「名前」を入力にする生物学的トークナイザーで配列モデルの解釈性を高める
この論文は、DNA配列を扱う言語モデル向けの新しいトークナイザー「Motif‑Vocab」を紹介します。Motif‑Vocabは配列をスキャンして、既知の転写因子(TF:DNAに結合して遺伝子発現を制御するタンパク質)のモチーフに統計的に有意な一致があれば、そのTFの「識別トークン」を出力します。モチーフに一致しない部分は塩基、固定長-kmer(6-mer など)、あるいはバイトペアエンコーディング(BPE)で表現します。こうしてトークンを遺伝学的に意味のある単位に結びつけられます。
研究者たちはまずモチーフを位置頻度行列(PFM)から位置確率行列(PPM)、さらにログオッズのポジション・ウェイト・マトリクス(PWM)に変換しました。各PWMについて背景配列に基づく「ヌル分布」を動的計算で事前に作り、異なる長さや多様性のモチーフ間でスコアを同じ有意度尺度に揃えます。オンライン処理では両鎖を走査し、閾値を満たす一致を一つのTFトークンにまとめ、重複候補は決定論的な規則で解決します。未検出領域はフォールバック表現で埋め、トークンごとの塩基区間を保持してマスキングや解釈に使えるようにします。データには公開モチーフ集(JASPAR)を用いました。
評価は制御された実験で行われ、BERT(Bidirectional Encoder Representations from Transformers)を二十億塩基(2 billion base pairs)のコーパスで事前学習した設定を基本に、12種類のトークナイザー変種と55の下流タスクを比較しました。結果として実在のモチーフライブラリはランダム化したモチーフ対照より54/55のタスクで上回りました。特にDART‑Eval由来の「モチーフ分離認識」タスクでは、TF固有トークンが位置を合わせた一般的なモチフトークンに比べてmacro‑F1を0.040、モチーフを使わないトークナイザーに比べて0.033改善しました(95% ブートストラップ信頼区間:0.027–0.038)。また、モチフトークンは説明手法(アトリビューション)で高い重要度を示し、トークンを隠すと予測に大きな変化(オクルージョン効果)が見られました。
この手法の価値は、モデル入力に既知の生物学的意味を持つ記号を導入できる点です。TFトークンを使うと、どの転写因子に由来する信号がモデルの予測に寄与しているかを直接たどりやすくなります。これにより、配列ベースの規制領域(遺伝子発現を制御する非コード領域)の解釈や、どのモチーフがモデルの判断を支えているかを調べることが容易になります。
重要な留意点も示されています。Motif‑Vocabはすべての場面で既存手法を上回るわけではありません。情報密度の高い「モチーフ非依存」型のトークナイザーは依然として汎用的な強力ベースラインであり、5タスクのBERT‑baseパネルではほぼ互角の結果もありました。さらに評価は論文で用いた事前学習規模とタスク群に基づくものであり、他のモデルや応用領域にそのまま当てはまるとは限りません。計算的には、生のモチフスキャンは高コストなので論文ではヌル分布を事前計算して高速化していますが、モチーフベースの処理が常に実用的かどうかは利用条件に依存します。