Chemistry Labs

Chimie théorique et computationnelle

Apprentissage automatique pour prédire propriétés et réactions

Étudier comment représentations moléculaires, partitions de données et incertitude conditionnent les prédictions de propriétés et de résultats réactionnels.

IntuitionApprendre des motifs, pas des lois chimiques

Un modèle associe une représentation moléculaire à une cible : solubilité, énergie ou produit réactionnel. Il apprend des corrélations ; sens chimique et fiabilité dépendent des données et de la ressemblance des nouvelles molécules aux exemples.

Comparer les chaînes de régression de propriétés et de classement de produits, de l’entrée moléculaire à la prédiction.

ScolaireUne prédiction est une application

Définition: Descripteur et cible

Le vecteur de descripteurs x\mathbf x encode une molécule ou réaction ; la cible yy est la grandeur mesurée ou calculée à prédire. La fonction apprise f(x)f(\mathbf x) approxime la relation dans la distribution d’entraînement.

f^=arg⁡min⁡f1N∑i=1Nℓ ⁣(f(xi),yi)+λ Ω(f)\hat f=\arg\min_f\frac1N\sum_{i=1}^{N}\ell\!\left(f(\mathbf x_i),y_i\right)+\lambda\,\Omega(f)

La perte ℓ\ell mesure l’erreur et Ω\Omega régularise la complexité. Une faible perte d’entraînement ou un grand réseau ne garantit pas l’utilité chimique ; la validation doit refléter la tâche visée.

Exemple: Choisir une partition adaptée

Un modèle prédit des propriétés de nouveaux échafaudages, mais une partition aléatoire par molécule place des analogues dans les deux ensembles. Quelle évaluation teste mieux la généralisation aux échafaudages ?

Solution

Utiliser un découpage par échafaudage, en excluant des familles structurales entières de l’entraînement. Le test est plus difficile mais mieux adapté à l’usage visé.

UniversitaireReprésentations moléculaires et tâches réactionnelles

ReprésentationEncodePrécaution
Empreinte moléculaireSous-structures localesPeut omettre géométrie ou contexte
GrapheAtomes et liaisonsGérer soigneusement 3D et stéréochimie

La prédiction réactionnelle représente réactifs, conditions et produits. Un modèle peut classer des produits candidats ou prédire des modifications de graphe. Un score élevé dépend des données et conditions représentées, sans garantir le rendement expérimental.

AvancéGénéralisation, calibration et validité chimique

Un benchmark doit éviter les fuites, séparer les quasi-doublons si nécessaire et rapporter des métriques adaptées. La calibration vérifie si la confiance annoncée correspond à la fréquence de réussite. Domaine d’applicabilité et incertitude signalent l’extrapolation sans corriger des étiquettes biaisées ou incomplètes.

RechercheFrontière : une chimie fiable à partir de données imparfaites

Références

  • Machine learning for molecular and materials science · Keith T. Butler, Daniel W. Davies, Hugh Cartwright, Olexandr Isayev, and Aron Walsh, 2018
  • Molecular Transformer: A Model for Uncertainty-Calibrated Chemical Reaction Prediction · Philippe Schwaller, Teodoro Laino, Théophile Gaudin, Peter Bolgar, Christopher A. Hunter, Costas Bekas, and Alpha A. Lee, 2019