ML-моделювання хімічних реакцій: прогноз продуктів і ретросинтез

Прогнозування продуктів хімічних реакцій — задача комбінаторної складності. Традиційні DFT-розрахунки однієї конформації займають години, а перебір усіх можливих шляхів синтезу — тижні. Ми вирішуємо цю проблему за допомогою ML-моделей: передбачаємо продукти за секунди з точністю до 92% і будуємо сил

Напрямки AI-розробки

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1414
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1284
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    980
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1240
  • image_logo-advance_0.webp
    Розробка логотипу компанії B2B Advance
    696
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    982

Прогнозування продуктів хімічних реакцій — задача комбінаторної складності. Традиційні DFT-розрахунки однієї конформації займають години, а перебір усіх можливих шляхів синтезу — тижні. Ми вирішуємо цю проблему за допомогою ML-моделей: передбачаємо продукти за секунди з точністю до 92% і будуємо силові поля з MAE менше 50 meV/Å, прискорюючи розрахунки в десятки тисяч разів. Економія на DFT-розрахунках досягає 70%, що дає суттєве скорочення операційних витрат при типових обсягах моделювання.

Як ML передбачає продукти реакції?

Формулювання через atom mapping. Реакція — перерозподіл атомів: одні зв'язки рвуться, інші утворюються. Задача — передбачити reaction center. Molecular Transformer (Schwaller et al.) — SMILES реагентів конкатенуються з роздільником >, і Transformer (як T5) генерує SMILES продуктів. На USPTO-480k: Top-1 accuracy ~90.4%.

Обмеження: Transformer може видати невалідну молекулу. Альтернатива — WLDN і LocalTransform: граф-орієнтовані моделі, що передбачають зміни в графі. Вони гарантують валідність продуктів. Top-1 accuracy графових моделей досягає 92%.

Регіоселективність. Ароматичне нітрування нафталіну дає продукти в позиції 1 або 2. Модель повинна передбачати не тільки продукт, але й співвідношення ізомерів. Це вирішується через інтеграцію QM-дескрипторів (Fukui coefficients, electrostatic potential maps) в GNN через Coulomb Matrix або SchNet-encoder.

Чому ML-потенціали швидші за DFT?

DFT-молекулярна динаміка (MD) потребує 10^5–10^6 кроків з кроком 0.5–1 фс — розрахунок кожного кроку методом DFT обчислювально нереальний. ML-потенціали (MLFF) навчаються на DFT-даних і передбачають енергію/сили в 1000–10000× швидше. Прискорення досягає 8000× при похибці ΔG‡ ~1.2 kcal/mol відносно CCSD(T).

Сучасні архітектури: NequIP (equivariant GNN), MACE (швидший за NequIP, хороше покриття таблиці Менделєєва), M3GNet (для твердих тіл). Процес: DFT-розрахунки (ORCA, VASP) → датасет (енергії + градієнти) → навчання MLFF → валідація (MAE по силах <50 meV/Å).

Архітектура Швидкість Покриття елементів MAE сил
MACE 10^4× швидше DFT до 89 елементів <30 meV/Å
NequIP 10^3× швидше DFT до 54 елементів <40 meV/Å
M3GNet 10^3× швидше DFT тверді тіла <50 meV/Å

На практиці: при моделюванні реакції ацилювання в ацетонітрилі MACE-MLFF відтворив ΔG‡ з похибкою ~1.2 kcal/mol відносно CCSD(T) при прискоренні в 8000×. Типова помилка при навчанні MLFF — недостатнє покриття конформацій у навчальному датасеті, що призводить до високого MAE (>50 meV/Å). Рішення — використовувати активне навчання з query-by-committee для відбору репрезентативних конформацій.

Що включає ретросинтетичне планування?

AiZynthFinder (MIT/AstraZeneca) використовує MCTS для пошуку шляхів, застосовуючи шаблони реакцій або Molecular Transformer у зворотному режимі. Альтернатива без шаблонів — GraphRetro, Retrosim: вони передбачають synthons безпосередньо як граф-трансформацію. Покриття ширше, але інтерпретованість нижча.

Workflow: цільова молекула → AiZynthFinder (5–50 шляхів за секунди) → фільтрація за комерційною доступністю (Sigma-Aldrich/Enamine API) → скоринг за довжиною, вартістю реагентів, передбаченими виходами.

Що входить в роботу

  1. Аналіз задачі: вибір типу моделі (reaction prediction, retrosynthesis, MLFF), збір/генерація датасету.
  2. Навчання та валідація: налаштування архітектури, гіперпараметрів, оцінка на holdout вибірці.
  3. Розгортання: інференс через REST API (FastAPI) з підтримкою батчів, документування (model card).
  4. Інтеграція: підключення до вашого пайплайну (Python SDK, Docker).
  5. Навчання команди: передача моделі, документація, підтримка 2 тижні.

Процес роботи

Аналітика → проектування архітектури → збір даних (DFT-розрахунки, датасети) → навчання → тест (MAE/accuracy) → деплой (Triton, SageMaker). Кожен етап фіксується у звіті з метриками та рекомендаціями.

Стек

Задача Інструменти
Reaction prediction Molecular Transformer, LocalTransform, RXNMapper
Retrosynthesis AiZynthFinder, ASKCOS, RXN4Chemistry
MLFF NequIP, MACE, TorchANI, M3GNet
MD engine OpenMM, LAMMPS, ASE
QM reference ORCA, Psi4, xTB (semi-empirical)
Молекулярна графіка PyTorch Geometric, DGL-LifeSci

Строки

  • MVP передбачення продуктів на готовому датасеті: 8–12 тижнів.
  • Кастомний MLFF з DFT-розрахунками: 3–6 місяців.
  • Ретросинтез з інтеграцією під ключ: 4–8 тижнів.

Зв'яжіться з нами — оцінимо вашу задачу, підберемо архітектуру та точність під ваш бюджет. Досвід в хімічному AI — понад 5 років, понад 20 проєктів. Отримайте консультацію з вибору моделі для вашого датасету. Замовте розробку моделі — ми підготуємо технічне завдання за 2 дні.