理論・計算化学
機械学習による物性・反応予測
分子表現、データ分割、不確かさが、機械学習による物性・反応結果の予測をどう左右するかを学びます。
直観化学法則ではなくパターンを学ぶ
モデルは分子表現を溶解度・エネルギー・反応生成物などの目標へ写像します。例から相関を学ぶため、化学的意味と信頼性はデータの内容と新規分子の類似性に左右されます。
学校予測は写像である
定義: 特徴量と目的変数
特徴ベクトル は分子または反応を符号化し、目的変数 は予測対象の測定・計算量です。学習関数 は訓練分布内の関係を近似します。
損失 は予測誤差を測り、 はモデルの複雑さを正則化します。訓練損失が小さいことや大規模なニューラルネットワークは化学的有用性を保証せず、検証方法は目的の予測課題に対応すべきです。
例: 適切な分割を選ぶ
新規骨格の物性を予測するモデルで、分子単位の無作為分割では類似体が訓練・試験の両方に入ります。骨格への汎化をより適切に評価する方法は何ですか。
解答
骨格単位のホールドアウトを用い、構造ファミリー全体を訓練から除外します。より難しいものの、想定する利用場面に即した試験です。
大学分子表現と反応タスク
| 表現 | 符号化対象 | 注意点 |
|---|---|---|
| フィンガープリント | 局所部分構造 | 幾何・文脈を失う場合 |
| グラフ | 原子と結合 | 3D・立体化学の扱いが重要 |
反応予測では反応物・条件・生成物を表現します。候補生成物の順位付けや分子グラフ編集の予測が可能です。高い生成物スコアはデータと表現された条件に依存し、実験収率を保証しません。
上級汎化・較正・化学的妥当性
ベンチマークでは情報漏洩を防ぎ、必要に応じて近似重複を分離し、用途に合う指標を報告します。較正は予測信頼度が実際の正答率と一致するかを問います。適用領域と不確かさ推定は外挿の検出に役立ちますが、偏った・不完全なラベルは補えません。
研究研究最前線:不完全なデータから信頼できる化学へ
参考文献
- Machine learning for molecular and materials science · Keith T. Butler, Daniel W. Davies, Hugh Cartwright, Olexandr Isayev, and Aron Walsh, 2018
- Molecular Transformer: A Model for Uncertainty-Calibrated Chemical Reaction Prediction · Philippe Schwaller, Teodoro Laino, Théophile Gaudin, Peter Bolgar, Christopher A. Hunter, Costas Bekas, and Alpha A. Lee, 2019