Половина кандидатів у ліки провалюється через ADMET-проблеми — токсичність, небажаний метаболізм, низьке всмоктування. Кожна така молекула забирає мільйони доларів на етапі доклініки. Ми розробляємо AI-системи, що передбачають ADMET з точністю, достатньою для відбору молекул до синтезу. За даними Nature Reviews Drug Discovery, близько 50% невдач пов'язані саме з ADMET.
Чому критично передбачати ADMET на ранніх стадіях?
Пізнє виявлення ADMET-проблем — одна з головних причин зриву клінічних випробувань. Наприклад, блокада hERG-каналу призводить до летальної аритмії та відкликання препарату з ринку. Наша модель, навчена на тисячах сполук, виявляє такі ризики за секунди. Точність передбачення hERG inhibition перевищує 85% ROC-AUC. Типовий проект із впровадження ADMET-моделі економить значні кошти на доклінічних дослідженнях і скорочує цикл розробки на 12–18 місяців.
Які моделі показують найкращі результати для ADMET?
Graph Neural Networks (MPNN, D-MPNN) — сучасний стандарт. GNN перевершують fingerprint+ML на 15–20% за ROC-AUC на бенчмарках Therapeutics Data Commons (TDC). Але для невеликих датасетів добре працюють XGBoost на ECFP4-відбитках — швидше та інтерпретованіше. Ми комбінуємо обидва підходи в ансамблі.
| Підхід | Точність (ROC-AUC) | Інтерпретованість | Швидкість інференсу |
|---|---|---|---|
| ECFP + XGBoost | 0.75–0.82 | Висока (SHAP) | <1 мс на молекулу |
| GNN | 0.83–0.92 | Середня (увага) | 2–5 мс на молекулу |
| Multitask GNN | 0.85–0.94 | Середня | 2–5 мс на всі завдання |
Multitask навчання об'єднує 20+ ADMET-завдань в одній моделі. Shared representations покращують передбачення для властивостей з малою кількістю даних. Наприклад, модель навчається на solubility, logP і hERG одночасно.
from chemprop import args, data, featurizers, models, train # Chemprop — state-of-the-art для молекулярного ADMET arguments = [ '--data_path', 'admet_train.csv', '--dataset_type', 'regression', '--target_columns', 'solubility logP hERG_inhibition caco2_permeability', '--smiles_columns', 'smiles', '--epochs', '50', '--batch_size', '64', '--ffn_num_layers', '3', '--dropout', '0.1', '--save_dir', 'admet_model', ] args.parse_train_args(arguments) train.cross_validate(...) Окрім ROC-AUC, ми використовуємо PR-AUC, F1-score та коефіцієнт калібрування (Expected Calibration Error). Для задач регресії — RMSE та R².
Як підвищити точність передбачення метаболізму CYP450?
Предсказание метаболизму ферментами семейства CYP450 — одна з найскладніших задач ADMET. Ізоформи CYP3A4, CYP2D6, CYP2C9 метаболізують більшість ліків. Для підвищення точності застосовуємо multi-task навчання з додаванням дескрипторів молекулярного докінгу. Така модель досягає F1-score 0.88 на тесті, що на 8% краще за single-task аналог.
| Метод оцінки невизначеності | Достовірність інтервалів | Обчислювальна складність |
|---|---|---|
| Deep Ensembles | 95% покриття | Висока (5 моделей) |
| Conformal Prediction | 90% покриття | Низька (після калібрування) |
| MC Dropout | 85% покриття | Середня (50 forward passes) |
Як оцінюється невизначеність передбачень?
Модель може бути ненадійною для молекул, далеких від навчального розподілу. Ми використовуємо Conformal Prediction — метод, що дає статистично строгі передбачувальні інтервали без припущень про розподіл. При виході за applicability domain система видає явне попередження "low confidence prediction". Ми застосовуємо кілька методів визначення applicability domain: Tanimoto similarity до найближчих сусідів, leverage (Williams plot) та відстань до k-NN у просторі ембендінгів.
Що входить у результат
- Навчена модель (формат ONNX або TorchScript)
- REST API з документацією OpenAPI
- Звіт з метриками (ROC-AUC, PR-AUC, калібрування)
- Аналіз області застосовності та невизначеності
- Навчання команди роботі з моделлю
- Гарантійна підтримка 3 місяці
Як ми працюємо
- Аналіз задач: визначаємо цільові ADMET-властивості, збираємо та чистимо датасети.
- Моделювання: експериментуємо з архітектурами, підбираємо гіперпараметри (Weights & Biases).
- Валідація: крос-валідація, тестування на held-out сетах, перевірка на зовнішніх бенчмарках.
- Інтеграція: розгортання на вашій інфраструктурі (SageMaker, Vertex AI) або on-premise.
- Передача: код, модель, документація, навчання.
Терміни: від 3 тижнів для однієї задачі до 3 місяців для повноцінної multitask-системи. Вартість розраховується індивідуально — зв'яжіться з нами, і ми підготуємо комерційну пропозицію.
Наші компетенції
5+ років досвіду в AI для drug discovery, понад 50 реалізованих проектів у галузі молекулярного моделювання. Гарантуємо якість та дотримання термінів. Використовуємо сучасний стек: PyTorch, Hugging Face Transformers, Chemprop, RDKit, Weights & Biases. Замовте безкоштовний аналіз ваших даних — ми перевіримо їх придатність для ADMET-моделювання та запропонуємо оптимальну архітектуру. Отримайте консультацію прямо зараз, надіславши запит через форму на сайті.







