分子の「高次」構造を順序列で表す新表現 HGR:環構造を正しく扱い、生成と学習の性能を改善
この論文は、分子の複雑な「高次」トポロジーをより正確に表現する新しい方法を示します。高次トポロジーとは、分子内のリング(環)や繰り返し現れる部分構造など、単純な原子や結合の並びだけでは捉えにくい大きな構造を指します。著者らはこれをそのまま扱える表現、Higher-order Grammar Representation(HGR)を提案しました。
研究チームはまず分子を「組合せ複体(combinatorial complex)」という数学的な構造に持ち上げます。これは分子の環や部品のつながり方を明示する方法です。その複体を文法で解析し、生成規則(production rules)の短い列に変換します。生成規則とは、複雑な構造を段階的に組み立てるための指示書のようなものです。ここでは「文脈自由高次文法(context-free higher-order grammar)」という枠組みを使っていますが、要するに複雑な形を一列の記号で表せるようにした、ということです。
この手法の利点は、高次の構造情報をそのまま「ルールの列」に直して、既存の順序データ用モデル(例えば言語モデルのようなシーケンスモデル)で扱える点です。これにより高次構造を明示的に扱う従来法で生じがちな計算負荷を抑えつつ、トポロジーの表現力は保てます。論文によれば、生成モデルにおいてHGRベースのモデルは「構築上100%の有効分子」を保証し、5つの生成ベンチマークすべてでFCD(Fréchet ChemNet Distance)に基づく順位で1位になりました。
評価を支えるデータセットも整えています。著者らは、単純な環だけに偏らないように設計した「RingDiv」というリング濃縮ベンチマークを作成しました。RingDivは118万(1.18 million)分子を含み、そのうち厳選したRingDiv300kという30万分子のサブセットも公開しています。さらにリング系の多様性を数値化する指標、ring diversity index(RDI)も導入しています。表現学習の評価では、HGRを使った基盤モデル HGR-FM がMoleculeNetの7つのベンチマークで平均AUC(受信者操作特性下面積)が最高となり、既存最強のベースラインに対してプロービング(下流評価)の設定で+8.3、完全ファインチューニングで+3.3ポイントの改善を報告しています。
なぜ重要かというと、薬や材料の設計では環構造や繰り返し部分が性質に大きく影響します。これらを直接かつ効率よくモデルに取り込めれば、より現実的で有効な分子を生成したり、既存のデータから汎用的な分子表現を学んだりする能力が高まります。HGRはそのための新しい橋渡し手法を提供します。
注意点として、論文の主張はベンチマークと用意したデータセット上の結果に基づきます。実際の創薬や材料探索の現場での効果や限界は、さらに多様な化学空間や実務的制約で検証する必要があります。また、抽象ではHGRが計算負荷を抑えるとしていますが、実装や大規模運用での具体的な計算コストや適用範囲については、今後の詳細な公開と検証を待つ必要があります。