Прогнозування продуктів хімічних реакцій — задача комбінаторної складності. Традиційні DFT-розрахунки однієї конформації займають години, а перебір усіх можливих шляхів синтезу — тижні. Ми вирішуємо цю проблему за допомогою ML-моделей: передбачаємо продукти за секунди з точністю до 92% і будуємо силові поля з MAE менше 50 meV/Å, прискорюючи розрахунки в десятки тисяч разів. Економія на DFT-розрахунках досягає 70%, що дає суттєве скорочення операційних витрат при типових обсягах моделювання.
Як ML передбачає продукти реакції?
Формулювання через atom mapping. Реакція — перерозподіл атомів: одні зв'язки рвуться, інші утворюються. Задача — передбачити reaction center. Molecular Transformer (Schwaller et al.) — SMILES реагентів конкатенуються з роздільником >, і Transformer (як T5) генерує SMILES продуктів. На USPTO-480k: Top-1 accuracy ~90.4%.
Обмеження: Transformer може видати невалідну молекулу. Альтернатива — WLDN і LocalTransform: граф-орієнтовані моделі, що передбачають зміни в графі. Вони гарантують валідність продуктів. Top-1 accuracy графових моделей досягає 92%.
Регіоселективність. Ароматичне нітрування нафталіну дає продукти в позиції 1 або 2. Модель повинна передбачати не тільки продукт, але й співвідношення ізомерів. Це вирішується через інтеграцію QM-дескрипторів (Fukui coefficients, electrostatic potential maps) в GNN через Coulomb Matrix або SchNet-encoder.
Чому ML-потенціали швидші за DFT?
DFT-молекулярна динаміка (MD) потребує 10^5–10^6 кроків з кроком 0.5–1 фс — розрахунок кожного кроку методом DFT обчислювально нереальний. ML-потенціали (MLFF) навчаються на DFT-даних і передбачають енергію/сили в 1000–10000× швидше. Прискорення досягає 8000× при похибці ΔG‡ ~1.2 kcal/mol відносно CCSD(T).
Сучасні архітектури: NequIP (equivariant GNN), MACE (швидший за NequIP, хороше покриття таблиці Менделєєва), M3GNet (для твердих тіл). Процес: DFT-розрахунки (ORCA, VASP) → датасет (енергії + градієнти) → навчання MLFF → валідація (MAE по силах <50 meV/Å).
| Архітектура | Швидкість | Покриття елементів | MAE сил |
|---|---|---|---|
| MACE | 10^4× швидше DFT | до 89 елементів | <30 meV/Å |
| NequIP | 10^3× швидше DFT | до 54 елементів | <40 meV/Å |
| M3GNet | 10^3× швидше DFT | тверді тіла | <50 meV/Å |
На практиці: при моделюванні реакції ацилювання в ацетонітрилі MACE-MLFF відтворив ΔG‡ з похибкою ~1.2 kcal/mol відносно CCSD(T) при прискоренні в 8000×. Типова помилка при навчанні MLFF — недостатнє покриття конформацій у навчальному датасеті, що призводить до високого MAE (>50 meV/Å). Рішення — використовувати активне навчання з query-by-committee для відбору репрезентативних конформацій.
Що включає ретросинтетичне планування?
AiZynthFinder (MIT/AstraZeneca) використовує MCTS для пошуку шляхів, застосовуючи шаблони реакцій або Molecular Transformer у зворотному режимі. Альтернатива без шаблонів — GraphRetro, Retrosim: вони передбачають synthons безпосередньо як граф-трансформацію. Покриття ширше, але інтерпретованість нижча.
Workflow: цільова молекула → AiZynthFinder (5–50 шляхів за секунди) → фільтрація за комерційною доступністю (Sigma-Aldrich/Enamine API) → скоринг за довжиною, вартістю реагентів, передбаченими виходами.
Що входить в роботу
- Аналіз задачі: вибір типу моделі (reaction prediction, retrosynthesis, MLFF), збір/генерація датасету.
- Навчання та валідація: налаштування архітектури, гіперпараметрів, оцінка на holdout вибірці.
- Розгортання: інференс через REST API (FastAPI) з підтримкою батчів, документування (model card).
- Інтеграція: підключення до вашого пайплайну (Python SDK, Docker).
- Навчання команди: передача моделі, документація, підтримка 2 тижні.
Процес роботи
Аналітика → проектування архітектури → збір даних (DFT-розрахунки, датасети) → навчання → тест (MAE/accuracy) → деплой (Triton, SageMaker). Кожен етап фіксується у звіті з метриками та рекомендаціями.
Стек
| Задача | Інструменти |
|---|---|
| Reaction prediction | Molecular Transformer, LocalTransform, RXNMapper |
| Retrosynthesis | AiZynthFinder, ASKCOS, RXN4Chemistry |
| MLFF | NequIP, MACE, TorchANI, M3GNet |
| MD engine | OpenMM, LAMMPS, ASE |
| QM reference | ORCA, Psi4, xTB (semi-empirical) |
| Молекулярна графіка | PyTorch Geometric, DGL-LifeSci |
Строки
- MVP передбачення продуктів на готовому датасеті: 8–12 тижнів.
- Кастомний MLFF з DFT-розрахунками: 3–6 місяців.
- Ретросинтез з інтеграцією під ключ: 4–8 тижнів.
Зв'яжіться з нами — оцінимо вашу задачу, підберемо архітектуру та точність під ваш бюджет. Досвід в хімічному AI — понад 5 років, понад 20 проєктів. Отримайте консультацію з вибору моделі для вашого датасету. Замовте розробку моделі — ми підготуємо технічне завдання за 2 дні.







