Прогнозирование продуктов химических реакций — задача комбинаторной сложности. Традиционные DFT-расчёты одной конформации занимают часы, а перебор всех возможных путей синтеза — недели. Мы решаем эту проблему с помощью ML-моделей: предсказываем продукты за секунды с точностью до 92% и строим силовые поля с MAE менее 50 meV/Å, ускоряя расчёты в десятки тысяч раз. Экономия на DFT-расчётах достигает 70%, что даёт существенное сокращение операционных затрат при типичных объёмах моделирования.
Как ML предсказывает продукты реакции?
Формулировка через atom mapping. Реакция — перераспределение атомов: одни связи рвутся, другие образуются. Задача — предсказать reaction center. Molecular Transformer (Schwaller et al.) — SMILES реагентов конкатенируются с разделителем >, и Transformer (как T5) генерирует SMILES продуктов. На USPTO-480k: Top-1 accuracy ~90.4%.
Ограничение: Transformer может выдать невалидную молекулу. Альтернатива — WLDN и LocalTransform: граф-ориентированные модели, предсказывающие изменения в графе. Они гарантируют валидность продуктов. Top-1 accuracy графовых моделей достигает 92%.
Региоселективность. Ароматическое нитрование нафталина даёт продукты в позиции 1 или 2. Модель должна предсказывать не только продукт, но и соотношение изомеров. Это решается через интеграцию QM-дескрипторов (Fukui coefficients, electrostatic potential maps) в GNN через Coulomb Matrix или SchNet-encoder.
Почему ML-потенциалы быстрее DFT?
DFT-молекулярная динамика (MD) требует 10^5–10^6 шагов с шагом 0.5–1 фс — расчёт каждого шага методом DFT вычислительно нереален. ML-потенциалы (MLFF) обучаются на DFT-данных и предсказывают энергию/силы в 1000–10000× быстрее. Ускорение достигает 8000× при ошибке ΔG‡ ~1.2 kcal/mol относительно CCSD(T).
Современные архитектуры: NequIP (equivariant GNN), MACE (быстрее NequIP, хорошее покрытие таблицы Менделеева), M3GNet (для твёрдых тел). Процесс: DFT-расчёты (ORCA, VASP) → датасет (энергии + градиенты) → обучение MLFF → валидация (MAE по силам <50 meV/Å).
| Архитектура | Скорость | Покрытие элементов | MAE сил |
|---|---|---|---|
| MACE | 10^4× быстрее DFT | до 89 элементов | <30 meV/Å |
| NequIP | 10^3× быстрее DFT | до 54 элементов | <40 meV/Å |
| M3GNet | 10^3× быстрее DFT | твёрдые тела | <50 meV/Å |
На практике: при моделировании реакции ацилирования в ацетонитриле MACE-MLFF воспроизвёл ΔG‡ с ошибкой ~1.2 kcal/mol относительно CCSD(T) при ускорении в 8000×. Типичная ошибка при обучении MLFF — недостаточное покрытие конформаций в обучающем датасете, что приводит к высокому MAE (>50 meV/Å). Решение — использовать активное обучение с query-by-committee для отбора репрезентативных конформаций.
Что включает ретросинтетическое планирование?
AiZynthFinder (MIT/AstraZeneca) использует MCTS для поиска путей, применяя шаблоны реакций или Molecular Transformer в обратном режиме. Альтернатива без шаблонов — GraphRetro, Retrosim: они предсказывают synthons напрямую как граф-трансформацию. Покрытие шире, но интерпретируемость ниже.
Workflow: целевая молекула → AiZynthFinder (5–50 путей за секунды) → фильтрация по коммерческой доступности (Sigma-Aldrich/Enamine API) → скоринг по длине, стоимости реагентов, предсказанным выходам.
Что входит в работу
- Анализ задачи: выбор типа модели (reaction prediction, retrosynthesis, MLFF), сбор/генерация датасета.
- Обучение и валидация: настройка архитектуры, гиперпараметров, оценка на holdout выборке.
- Развёртывание: инференс через REST API (FastAPI) с поддержкой батчей, документирование (model card).
- Интеграция: подключение к вашему пайплайну (Python SDK, Docker).
- Обучение команды: передача модели, документация, поддержка 2 недели.
Процесс работы
Аналитика → проектирование архитектуры → сбор данных (DFT-расчёты, датасеты) → обучение → тест (MAE/accuracy) → деплой (Triton, SageMaker). Каждый этап фиксируется в отчёте с метриками и рекомендациями.
Стек
| Задача | Инструменты |
|---|---|
| Reaction prediction | Molecular Transformer, LocalTransform, RXNMapper |
| Retrosynthesis | AiZynthFinder, ASKCOS, RXN4Chemistry |
| MLFF | NequIP, MACE, TorchANI, M3GNet |
| MD engine | OpenMM, LAMMPS, ASE |
| QM reference | ORCA, Psi4, xTB (semi-empirical) |
| Молекулярная графика | PyTorch Geometric, DGL-LifeSci |
Сроки
- MVP предсказания продуктов на готовом датасете: 8–12 недель.
- Кастомный MLFF с DFT-расчётами: 3–6 месяцев.
- Ретросинтез с интеграцией под ключ: 4–8 недель.
Свяжитесь с нами — оценим вашу задачу, подберём архитектуру и точность под ваш бюджет. Опыт в химическом AI — более 5 лет, более 20 проектов. Получите консультацию по выбору модели для вашего датасета. Закажите разработку модели — мы подготовим техническое задание за 2 дня.







