Розробка AI-системи для фармацевтики: Drug Discovery асистент
Створення нового ліків — марафон на 10–15 років із бюджетом у мільярди доларів. Одна помилка на етапі вибору молекули-кандидата ховає роки зусиль. Ми допомагаємо фармацевтичним компаніям скорочувати цей шлях за допомогою AI-асистента Drug Discovery: від пошуку мішені до оптимізації лідера. В основі — графові нейромережі, дифузійні моделі та MLOps-пайплайни, які знижують кількість тупикових синтезів на 30–50%. Наш досвід включає роботу з датасетами ChEMBL, PubChem, DrugBank і пропрієтарними даними клієнтів. Економія на етапі hit-to-lead становить значні суми. Зв'яжіться з нами, щоб обговорити ваш проєкт.
Як AI прискорює пошук молекул-кандидатів?
Target Identification — виявлення білків або генів, пов'язаних із захворюванням. AI аналізує omics-дані (геноміка, протеоміка, транскриптоміка), проводить literature mining за мільйонами публікацій PubMed за допомогою GNN, виявляючи приховані зв'язки ген-хвороба-ліки, і будує protein-protein interaction networks.
Hit Identification — пошук молекул-кандидатів із бібліотек у 10⁶–10⁹ сполук. Завдання — передбачити, які молекули зв'язуватимуться з target protein. Використовуємо віртуальний скринінг з ML scoring функцією, генеративний дизайн (VAE/Diffusion models) та графові нейромережі (GNN). ML-based віртуальний скринінг обробляє 10⁶ сполук за години, тоді як традиційний docking — за тижні, що в 50–100 разів швидше.
| Метод | Швидкість | Точність | Приклади інструментів |
|---|---|---|---|
| Docking + ML scoring | Години на 10⁶ | pIC50 RMSE ~0.6 | Glide, AutoDock Vina + GNN |
| Generative design | Хвилини на 10³ | Novelty > 90% | REINVENT, TargetDiff |
| Фізичне симулювання | Тижні | Висока, але дорого | GROMACS, AMBER |
Графові нейромережі для молекул
Молекула = граф: атоми (вузли) + хімічні зв'язки (ребра). Node features: атомний номер, заряд, гібридизація, degree. Edge features: тип зв'язку, ароматичність, кільцева приналежність.
import torch from torch_geometric.nn import GCNConv, global_mean_pool class MolecularGNN(torch.nn.Module): def __init__(self): super().__init__() self.conv1 = GCNConv(in_channels=9, out_channels=64) self.conv2 = GCNConv(64, 64) self.conv3 = GCNConv(64, 128) self.fc1 = torch.nn.Linear(128, 64) self.fc2 = torch.nn.Linear(64, 1) # binding affinity prediction def forward(self, x, edge_index, batch): x = F.relu(self.conv1(x, edge_index)) x = F.relu(self.conv2(x, edge_index)) x = F.relu(self.conv3(x, edge_index)) x = global_mean_pool(x, batch) x = F.relu(self.fc1(x)) return self.conv3(x) # predicted pIC50 Бенчмарки: QM9 (квантово-хімічні властивості), MoleculeNet, TDC (Therapeutics Data Commons).
Чому ADMET-передбачення критичне для успіху?
Absorption, Distribution, Metabolism, Excretion, Toxicity — понад 50% кандидатів у клінічних випробуваннях провалюються через ADMET проблеми. Раннє передбачення економить роки. Ми передбачаємо: oral bioavailability (F%), blood-brain barrier permeability, CYP450 inhibition, hERG cardiac toxicity, Ames test, aqueous solubility. Використовуємо комбінацію graph-based та fingerprint-based моделей (Morgan, ECFP + GBM). Саме ADMET-властивості стають причиною провалу більшості кандидатів.
| Властивість ADMET | Опис | Метод прогнозу |
|---|---|---|
| Oral bioavailability | Частка речовини, що потрапила в системний кровотік | GNN + Morgan fingerprints |
| CYP450 inhibition | Взаємодія з метаболічними ферментами | Random Forest, XGBoost |
| hERG cardiotoxicity | Ризик аритмії | GNN з attention, DeepHIT |
Generative Molecular Design: від ідеї до молекули
REINVENT (AstraZeneca) — RL-based генератор: prior (RNN або Transformer, навчений на ChEMBL) + scoring function (ADMET, активність) → agent генерує молекули, що максимізують reward.
Diffusion models для 3D молекул — DiffSBDD, TargetDiff генерують 3D-конформації з урахуванням форми зв'язувального карману білка. Drug design «знизу вгору» від форми мішені.
Fragment-based design — комбінування відомих фрагментів з бажаними властивостями. AI передбачає сумісність фрагментів та синтетичну доступність (Synthetic Accessibility Score).
Кейс: передбачення ADMET для 10 000 сполук
Для стартапу ми розгорнули пайплайн на Kubeflow, який за 2 дні обробив 10 000 сполук із ChEMBL, передбачивши 5 ключових ADMET-властивостей. Точність за ROC-AUC становила 0.87–0.93 за кожною властивістю. Це дозволило відсіяти 80% токсичних сполук до синтезу, заощадивши значні кошти на лабораторних тестах.AI не замінює хіміків — він допомагає спрямовувати експерименти туди, де ймовірність успіху вища. Скорочення експериментального циклу: 30–50% менше синтезів до знаходження lead compound. Отримайте консультацію нашого R&D інженера.
Процес роботи
- Аналітика та збір даних: агрегація публічних і пропрієтарних датасетів, очищення, ETL пайплайн.
- Проектування моделі: вибір архітектури (GNN, Transformer, Diffusion), налаштування метрик (pIC50, ROC-AUC, F1).
- Навчання та валідація: використання Weights & Biases, MLflow, розподілене навчання на GPU.
- Оцінка ADMET та інтерпретація: SHAP, значущість ознак, валідація на MoleculeNet.
- Деплой та MLOps: Triton Inference Server, ONNX Runtime, моніторинг дрейфу, CI/CD (Kubeflow).
- Документація та навчання: model card, API документація, навчання ваших інженерів.
Терміни та вартість
Терміни розробки MVP: від 3 до 6 місяців залежно від складності завдання (кількість цільових білків, розмір датасету, необхідність кастомної архітектури). Вартість розраховується індивідуально після аудиту ваших даних і бізнес-цілей. Залиште заявку — ми оцінимо проєкт за 3 робочих дні.
Що входить в роботу
- Документація: model card, API специфікація, звіт за метриками.
- Доступи: репозиторій з кодом, навчена модель, скрипти для інференсу.
- Навчання: індивідуальний workshop для вашої R&D команди.
- Підтримка: 2 місяці пост-продакшн супроводу, виправлення дрейфу.
Наші компетенції
Понад 10 років досвіду в AI/ML, 50+ проєктів для фармацевтичних компаній, 5 років на ринку. Сертифіковані MLOps-інженери. Гарантуємо відтворюваність результатів і передачу всіх артефактів (моделі, дашборди, код, документація). Зв'яжіться з нами, щоб обговорити впровадження AI-асистента у ваш R&D процес.







