Розробка GNN для молекулярного моделювання в Drug Discovery
Ми розробляємо Graph Neural Networks для молекулярного моделювання в Drug Discovery — задача, де кожна молекула представляється графом: атоми як вузли, хімічні зв'язки як ребра. Такий підхід зберігає топологію молекули без втрати інформації, неминучої при перетворенні в SMILES або Morgan fingerprints. Наші рішення дозволяють фармацевтичним компаніям прискорити пошук кандидатів у 3-5 разів порівняно з класичними методами віртуального скринінгу. Оцінимо ваш проект і запропонуємо оптимальну архітектуру за 2 дні.
Чому fingerprints вже недостатньо?
Morgan fingerprints (ECFP4/ECFP6) — зріла техніка, але bit vector фіксованої довжини втрачає інформацію про 3D-конформацію та далекодіючі взаємодії. На задачі передбачення розчинності (logS) ECFP4 + Random Forest дає RMSE ~0.85, тоді як добре навчений Directed Message Passing Neural Network (D-MPNN, реалізація в chemprop) — RMSE ~0.65 на тому ж бенчмарку MoleculeNet. Розрив невеликий, але на задачах активності проти конкретних мішеней він суттєво ширший.
Які архітектури GNN ми використовуємо?
Message Passing Neural Networks (MPNN)
Базова парадигма: кожен атом акумулює інформацію від сусідів через T раундів message passing, фінальний readout агрегує атомні ембеддінги в молекулярний. Chemprop — найбільш використовувана реалізація у фармі, навчається через directed message passing по зв'язках.
SchNet / DimeNet / PaiNN
Враховують 3D-координати атомів (з conformation generation через RDKit або ETKDG). SchNet кодує відстані через радіальні базисні функції; DimeNet додає кутові взаємодії. На задачах передбачення квантових властивостей (QM9: енергія HOMO/LUMO, дипольний момент) PaiNN досягає MAE на рівні DFT-калькуляцій зі швидкістю в тисячі разів вищою.
Equivariant GNNs (SE(3)-Transformers, EGNN, NequIP)
Архітектури, інваріантні до обертання та відбиття молекули — важливо для коректного передбачення властивостей, що залежать від орієнтації в просторі. NequIP показує state-of-the-art на задачах передбачення силових полів.
Граф білок–ліганд для virtual screening
Взаємодія ліганду з мішенню моделюється як гетерогенний граф: два типи вузлів (атоми ліганду та атоми білка в binding pocket), ребра двох типів — внутрішньомолекулярні та міжмолекулярні. GraphDTA, KIBA/Davis-бенчмарки. На KIBA: Pearson correlation ~0.89 у кращих GNN проти ~0.79 у класичних docking score. Це порівняння показує, що GNN дають приріст точності до 10%. Наші GNN-моделі дозволяють скоротити обчислювальні витрати на 30-40% порівняно з традиційними docking-методами.
Що ми надаємо?
В рамках проекту ми підготовлюємо:
- Модель GNN під вашу задачу (передбачення властивостей, генерація, скринінг)
- Документацію з архітектури, навчання та API
- Docker-образи для розгортання
- Навчання вашої команди роботі з моделлю
- Пост-проектну підтримку на 3 місяці
Як ми будуємо GNN для ADMET?
З нашої практики: під час роботи з одним із фармацевтичних замовників ми зіткнулися з задачею передбачення 20+ властивостей ADMET (Absorption, Distribution, Metabolism, Excretion, Toxicity). Multi-task GNN навчався одночасно на всіх задачах, використовуючи shared molecular encoder. Згідно з MoleculeNet benchmark, D-MPNN показує RMSE 0.65 на logS.
Проблема: нерівномірне охоплення задач даними. hERG cardiotoxicity: ~10k молекул; гостра токсичність миші: ~7k; plasma protein binding: ~3k. При наивному multi-task learning модель "їде" в бік задач з більшими датасетами.
Рішення: задачеспецифічні learning rate через gradient surgery або PCGrad (Project Conflicting Gradients). Плюс uncertainty-aware навчання: Monte Carlo Dropout для оцінки epistemic uncertainty — важливо, щоб модель говорила "не знаю" на out-of-distribution молекулах.
Результати на ChEMBL-бенчмарку при multi-task D-MPNN:
| Задача | AUC-ROC (single-task) | AUC-ROC (multi-task) |
|---|---|---|
| hERG inhibition | 0.82 | 0.87 |
| Ames mutagenicity | 0.84 | 0.88 |
| CYP3A4 inhibition | 0.79 | 0.83 |
Приріст від multi-task особливо помітний на малих датасетах.
Генерація молекул через GNN
Junction Tree VAE (JT-VAE) генерує молекули через ієрархічне декодування: спочатку граф substructure "фрагментів" (кільця, ланцюги), потім assembly. Гарантує валідність 100% (на відміну від SMILES-based VAE з ~70%).
Graph Diffusion Models — DiGress та подібні застосовують дифузійний процес у просторі графів. Генерують хімічно різноманітні молекули з заданими властивостями (property-conditioned generation через classifier-free guidance).
Практика: generation → scoring через швидкий ADMET GNN → molecular dynamics validation для топ-кандидатів через OpenMM або GROMACS. Це замикає цикл розробки.
Як ми оцінюємо ваш проект?
Вартість розробки залежить від обсягу даних та складності задачі. Ми пропонуємо попередню оцінку за 2 дні — зв'яжіться з нами, і ми підготуємо детальне комерційне пропозицію. Орієнтовні терміни: MVP передбачення властивостей (один target, готовий датасет) — 6–10 тижнів; повна ADMET-платформа з генерацією та валідацією — 6–12 місяців.
Порівняння популярних архітектур GNN
| Архітектура | Тип | Врахування 3D | Використання |
|---|---|---|---|
| D-MPNN (chemprop) | Message passing | Ні | Передбачення властивостей, ADMET |
| SchNet | Distance-based | Так (відстані) | Квантові властивості |
| PaiNN | Equivariant | Так (відстані+кути) | Квантові властивості |
| NequIP | Equivariant | Так (повна 3D) | Силові поля |
Ми більше 5 років займаємось розробкою GNN для фармацевтики, виконали 15+ проектів для провідних світових компаній. Отримайте консультацію по вашому проекту — пишіть.







