Chemistry Labs

理論・計算化学

機械学習による物性・反応予測

分子表現、データ分割、不確かさが、機械学習による物性・反応結果の予測をどう左右するかを学びます。

直観化学法則ではなくパターンを学ぶ

モデルは分子表現を溶解度・エネルギー・反応生成物などの目標へ写像します。例から相関を学ぶため、化学的意味と信頼性はデータの内容と新規分子の類似性に左右されます。

分子入力・表現から予測に至る、物性回帰と反応生成物ランキングの流れを比較します。

学校予測は写像である

定義: 特徴量と目的変数

特徴ベクトル x\mathbf x は分子または反応を符号化し、目的変数 yy は予測対象の測定・計算量です。学習関数 f(x)f(\mathbf x) は訓練分布内の関係を近似します。

f^=arg⁡min⁡f1N∑i=1Nℓ ⁣(f(xi),yi)+λ Ω(f)\hat f=\arg\min_f\frac1N\sum_{i=1}^{N}\ell\!\left(f(\mathbf x_i),y_i\right)+\lambda\,\Omega(f)

損失 ℓ\ell は予測誤差を測り、Ω\Omega はモデルの複雑さを正則化します。訓練損失が小さいことや大規模なニューラルネットワークは化学的有用性を保証せず、検証方法は目的の予測課題に対応すべきです。

例: 適切な分割を選ぶ

新規骨格の物性を予測するモデルで、分子単位の無作為分割では類似体が訓練・試験の両方に入ります。骨格への汎化をより適切に評価する方法は何ですか。

解答

骨格単位のホールドアウトを用い、構造ファミリー全体を訓練から除外します。より難しいものの、想定する利用場面に即した試験です。

大学分子表現と反応タスク

表現符号化対象注意点
フィンガープリント局所部分構造幾何・文脈を失う場合
グラフ原子と結合3D・立体化学の扱いが重要

反応予測では反応物・条件・生成物を表現します。候補生成物の順位付けや分子グラフ編集の予測が可能です。高い生成物スコアはデータと表現された条件に依存し、実験収率を保証しません。

上級汎化・較正・化学的妥当性

ベンチマークでは情報漏洩を防ぎ、必要に応じて近似重複を分離し、用途に合う指標を報告します。較正は予測信頼度が実際の正答率と一致するかを問います。適用領域と不確かさ推定は外挿の検出に役立ちますが、偏った・不完全なラベルは補えません。

研究研究最前線:不完全なデータから信頼できる化学へ

参考文献

  • Machine learning for molecular and materials science · Keith T. Butler, Daniel W. Davies, Hugh Cartwright, Olexandr Isayev, and Aron Walsh, 2018
  • Molecular Transformer: A Model for Uncertainty-Calibrated Chemical Reaction Prediction · Philippe Schwaller, Teodoro Laino, Théophile Gaudin, Peter Bolgar, Christopher A. Hunter, Costas Bekas, and Alpha A. Lee, 2019