ML-моделирование химических реакций: прогноз продуктов и ретросинтез

Прогнозирование продуктов химических реакций — задача комбинаторной сложности. Традиционные DFT-расчёты одной конформации занимают часы, а перебор всех возможных путей синтеза — недели. Мы решаем эту проблему с помощью ML-моделей: предсказываем продукты за секунды с точностью до 92% и строим силовые

Направления AI-разработки

Часто задаваемые вопросы

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1414
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1284
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    980
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1240
  • image_logo-advance_0.webp
    Разработка логотипа компании B2B Advance
    696
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    982

Прогнозирование продуктов химических реакций — задача комбинаторной сложности. Традиционные DFT-расчёты одной конформации занимают часы, а перебор всех возможных путей синтеза — недели. Мы решаем эту проблему с помощью ML-моделей: предсказываем продукты за секунды с точностью до 92% и строим силовые поля с MAE менее 50 meV/Å, ускоряя расчёты в десятки тысяч раз. Экономия на DFT-расчётах достигает 70%, что даёт существенное сокращение операционных затрат при типичных объёмах моделирования.

Как ML предсказывает продукты реакции?

Формулировка через atom mapping. Реакция — перераспределение атомов: одни связи рвутся, другие образуются. Задача — предсказать reaction center. Molecular Transformer (Schwaller et al.) — SMILES реагентов конкатенируются с разделителем >, и Transformer (как T5) генерирует SMILES продуктов. На USPTO-480k: Top-1 accuracy ~90.4%.

Ограничение: Transformer может выдать невалидную молекулу. Альтернатива — WLDN и LocalTransform: граф-ориентированные модели, предсказывающие изменения в графе. Они гарантируют валидность продуктов. Top-1 accuracy графовых моделей достигает 92%.

Региоселективность. Ароматическое нитрование нафталина даёт продукты в позиции 1 или 2. Модель должна предсказывать не только продукт, но и соотношение изомеров. Это решается через интеграцию QM-дескрипторов (Fukui coefficients, electrostatic potential maps) в GNN через Coulomb Matrix или SchNet-encoder.

Почему ML-потенциалы быстрее DFT?

DFT-молекулярная динамика (MD) требует 10^5–10^6 шагов с шагом 0.5–1 фс — расчёт каждого шага методом DFT вычислительно нереален. ML-потенциалы (MLFF) обучаются на DFT-данных и предсказывают энергию/силы в 1000–10000× быстрее. Ускорение достигает 8000× при ошибке ΔG‡ ~1.2 kcal/mol относительно CCSD(T).

Современные архитектуры: NequIP (equivariant GNN), MACE (быстрее NequIP, хорошее покрытие таблицы Менделеева), M3GNet (для твёрдых тел). Процесс: DFT-расчёты (ORCA, VASP) → датасет (энергии + градиенты) → обучение MLFF → валидация (MAE по силам <50 meV/Å).

Архитектура Скорость Покрытие элементов MAE сил
MACE 10^4× быстрее DFT до 89 элементов <30 meV/Å
NequIP 10^3× быстрее DFT до 54 элементов <40 meV/Å
M3GNet 10^3× быстрее DFT твёрдые тела <50 meV/Å

На практике: при моделировании реакции ацилирования в ацетонитриле MACE-MLFF воспроизвёл ΔG‡ с ошибкой ~1.2 kcal/mol относительно CCSD(T) при ускорении в 8000×. Типичная ошибка при обучении MLFF — недостаточное покрытие конформаций в обучающем датасете, что приводит к высокому MAE (>50 meV/Å). Решение — использовать активное обучение с query-by-committee для отбора репрезентативных конформаций.

Что включает ретросинтетическое планирование?

AiZynthFinder (MIT/AstraZeneca) использует MCTS для поиска путей, применяя шаблоны реакций или Molecular Transformer в обратном режиме. Альтернатива без шаблонов — GraphRetro, Retrosim: они предсказывают synthons напрямую как граф-трансформацию. Покрытие шире, но интерпретируемость ниже.

Workflow: целевая молекула → AiZynthFinder (5–50 путей за секунды) → фильтрация по коммерческой доступности (Sigma-Aldrich/Enamine API) → скоринг по длине, стоимости реагентов, предсказанным выходам.

Что входит в работу

  1. Анализ задачи: выбор типа модели (reaction prediction, retrosynthesis, MLFF), сбор/генерация датасета.
  2. Обучение и валидация: настройка архитектуры, гиперпараметров, оценка на holdout выборке.
  3. Развёртывание: инференс через REST API (FastAPI) с поддержкой батчей, документирование (model card).
  4. Интеграция: подключение к вашему пайплайну (Python SDK, Docker).
  5. Обучение команды: передача модели, документация, поддержка 2 недели.

Процесс работы

Аналитика → проектирование архитектуры → сбор данных (DFT-расчёты, датасеты) → обучение → тест (MAE/accuracy) → деплой (Triton, SageMaker). Каждый этап фиксируется в отчёте с метриками и рекомендациями.

Стек

Задача Инструменты
Reaction prediction Molecular Transformer, LocalTransform, RXNMapper
Retrosynthesis AiZynthFinder, ASKCOS, RXN4Chemistry
MLFF NequIP, MACE, TorchANI, M3GNet
MD engine OpenMM, LAMMPS, ASE
QM reference ORCA, Psi4, xTB (semi-empirical)
Молекулярная графика PyTorch Geometric, DGL-LifeSci

Сроки

  • MVP предсказания продуктов на готовом датасете: 8–12 недель.
  • Кастомный MLFF с DFT-расчётами: 3–6 месяцев.
  • Ретросинтез с интеграцией под ключ: 4–8 недель.

Свяжитесь с нами — оценим вашу задачу, подберём архитектуру и точность под ваш бюджет. Опыт в химическом AI — более 5 лет, более 20 проектов. Получите консультацию по выбору модели для вашего датасета. Закажите разработку модели — мы подготовим техническое задание за 2 дня.