Chimie théorique et computationnelle
Apprentissage automatique pour prédire propriétés et réactions
Étudier comment représentations moléculaires, partitions de données et incertitude conditionnent les prédictions de propriétés et de résultats réactionnels.
IntuitionApprendre des motifs, pas des lois chimiques
Un modèle associe une représentation moléculaire à une cible : solubilité, énergie ou produit réactionnel. Il apprend des corrélations ; sens chimique et fiabilité dépendent des données et de la ressemblance des nouvelles molécules aux exemples.
ScolaireUne prédiction est une application
Définition: Descripteur et cible
Le vecteur de descripteurs encode une molécule ou réaction ; la cible est la grandeur mesurée ou calculée à prédire. La fonction apprise approxime la relation dans la distribution d’entraînement.
La perte mesure l’erreur et régularise la complexité. Une faible perte d’entraînement ou un grand réseau ne garantit pas l’utilité chimique ; la validation doit refléter la tâche visée.
Exemple: Choisir une partition adaptée
Un modèle prédit des propriétés de nouveaux échafaudages, mais une partition aléatoire par molécule place des analogues dans les deux ensembles. Quelle évaluation teste mieux la généralisation aux échafaudages ?
Solution
Utiliser un découpage par échafaudage, en excluant des familles structurales entières de l’entraînement. Le test est plus difficile mais mieux adapté à l’usage visé.
UniversitaireReprésentations moléculaires et tâches réactionnelles
| Représentation | Encode | Précaution |
|---|---|---|
| Empreinte moléculaire | Sous-structures locales | Peut omettre géométrie ou contexte |
| Graphe | Atomes et liaisons | Gérer soigneusement 3D et stéréochimie |
La prédiction réactionnelle représente réactifs, conditions et produits. Un modèle peut classer des produits candidats ou prédire des modifications de graphe. Un score élevé dépend des données et conditions représentées, sans garantir le rendement expérimental.
AvancéGénéralisation, calibration et validité chimique
Un benchmark doit éviter les fuites, séparer les quasi-doublons si nécessaire et rapporter des métriques adaptées. La calibration vérifie si la confiance annoncée correspond à la fréquence de réussite. Domaine d’applicabilité et incertitude signalent l’extrapolation sans corriger des étiquettes biaisées ou incomplètes.
RechercheFrontière : une chimie fiable à partir de données imparfaites
Références
- Machine learning for molecular and materials science · Keith T. Butler, Daniel W. Davies, Hugh Cartwright, Olexandr Isayev, and Aron Walsh, 2018
- Molecular Transformer: A Model for Uncertainty-Calibrated Chemical Reaction Prediction · Philippe Schwaller, Teodoro Laino, Théophile Gaudin, Peter Bolgar, Christopher A. Hunter, Costas Bekas, and Alpha A. Lee, 2019