Chemistry Labs

理论与计算化学

用机器学习预测性质与反应

了解分子表示、数据划分与不确定性如何影响机器学习对化学性质和反应结果的预测。

直觉学习模式,而非化学定律

模型将分子表示映射到溶解度、能量或反应产物等目标。它从样例中学习相关性;化学含义与可靠性取决于数据代表什么,以及新分子是否类似训练数据。

比较从分子输入、表示到预测的性质回归流程与反应产物排序流程。

中学阶段预测是一种映射

定义: 特征与目标

特征向量 x\mathbf x 编码分子或反应;目标 yy 是待预测的实验或计算量。学习函数 f(x)f(\mathbf x) 近似训练分布中的关系。

f^=arg⁡min⁡f1N∑i=1Nℓ ⁣(f(xi),yi)+λ Ω(f)\hat f=\arg\min_f\frac1N\sum_{i=1}^{N}\ell\!\left(f(\mathbf x_i),y_i\right)+\lambda\,\Omega(f)

损失 ℓ\ell 衡量预测误差,Ω\Omega 正则化模型复杂度。训练损失小或神经网络大都不能保证化学上有用;验证方案必须对应预期任务。

例题: 选择合适的数据划分

模型要预测新骨架的性质,但按分子随机划分会使类似物同时进入训练集和测试集。哪种评估更能检验骨架泛化?

解答

采用骨架留出法,将整个结构家族排除在训练集之外。这种测试更难,但更符合实际部署情境。

大学分子表示与反应任务

表示编码内容注意事项
分子指纹局部子结构可能丢失几何或上下文
图原子与键需谨慎处理三维与立体化学

反应预测需要表示反应物、条件与产物。模型可对候选产物排序,或预测分子图编辑。较高的产物评分取决于数据及所表示的条件,并不保证实验产率。

进阶泛化、校准与化学有效性

基准设计应避免数据泄漏,适当分离近重复样本,并报告与应用匹配的指标。校准检验置信度是否符合实际正确率。适用域检查和不确定性估计有助识别外推,但无法修复有偏或不完整标签。

科研研究前沿:从不完美数据获得可靠化学预测

参考文献

  • Machine learning for molecular and materials science · Keith T. Butler, Daniel W. Davies, Hugh Cartwright, Olexandr Isayev, and Aron Walsh, 2018
  • Molecular Transformer: A Model for Uncertainty-Calibrated Chemical Reaction Prediction · Philippe Schwaller, Teodoro Laino, Théophile Gaudin, Peter Bolgar, Christopher A. Hunter, Costas Bekas, and Alpha A. Lee, 2019