Половина кандидатов в лекарства проваливается из-за ADMET-проблем — токсичности, нежелательного метаболизма, низкого всасывания. Каждая такая молекула отнимает миллионы долларов на этапе доклиники. Мы разрабатываем AI-системы, предсказывающие ADMET с точностью, достаточной для отбора молекул до синтеза. По данным Nature Reviews Drug Discovery, около 50% неудач связаны именно с ADMET.
Почему критично предсказывать ADMET на ранних стадиях?
Позднее обнаружение ADMET-проблем — одна из главных причин срыва клинических испытаний. Например, блокада hERG-канала ведёт к летальной аритмии и отзыву препарата с рынка. Наша модель, обученная на тысячах соединений, выявляет такие риски за секунды. Точность предсказания hERG inhibition превышает 85% ROC-AUC. Типичный проект по внедрению ADMET-модели экономит значительные средства на доклинических исследованиях и сокращает цикл разработки на 12–18 месяцев.
Какие модели показывают лучшие результаты для ADMET?
Graph Neural Networks (MPNN, D-MPNN) — современный стандарт. GNN превосходят fingerprint+ML на 15–20% по ROC-AUC на бенчмарках Therapeutics Data Commons (TDC). Но для небольших датасетов хорошо работают XGBoost на ECFP4-отпечатках — быстрее и интерпретируемее. Мы комбинируем оба подхода в ансамбле.
| Подход | Точность (ROC-AUC) | Интерпретируемость | Скорость инференса |
|---|---|---|---|
| ECFP + XGBoost | 0.75–0.82 | Высокая (SHAP) | <1 мс на молекулу |
| GNN | 0.83–0.92 | Средняя (внимание) | 2–5 мс на молекулу |
| Multitask GNN | 0.85–0.94 | Средняя | 2–5 мс на все задачи |
Multitask обучение объединяет 20+ ADMET-задач в одной модели. Shared representations улучшают предсказание для свойств с малым количеством данных. Например, модель обучается на solubility, logP и hERG одновременно.
from chemprop import args, data, featurizers, models, train # Chemprop — state-of-the-art для молекулярного ADMET arguments = [ '--data_path', 'admet_train.csv', '--dataset_type', 'regression', '--target_columns', 'solubility logP hERG_inhibition caco2_permeability', '--smiles_columns', 'smiles', '--epochs', '50', '--batch_size', '64', '--ffn_num_layers', '3', '--dropout', '0.1', '--save_dir', 'admet_model', ] args.parse_train_args(arguments) train.cross_validate(...) Помимо ROC-AUC, мы используем PR-AUC, F1-score и коэффициент калибровки (Expected Calibration Error). Для задач регрессии — RMSE и R².
Как повысить точность предсказания метаболизма CYP450?
Предсказание метаболизма ферментами семейства CYP450 — одна из сложнейших задач ADMET. Изоформы CYP3A4, CYP2D6, CYP2C9 метаболизируют большинство лекарств. Для повышения точности применяем multi-task обучение с добавлением дескрипторов молекулярного докинга. Такая модель достигает F1-score 0.88 на тесте, что на 8% лучше single-task аналога.
| Метод оценки неопределённости | Достоверность интервалов | Вычислительная сложность |
|---|---|---|
| Deep Ensembles | 95% покрытие | Высокая (5 моделей) |
| Conformal Prediction | 90% покрытие | Низкая (после калибровки) |
| MC Dropout | 85% покрытие | Средняя (50 forward passes) |
Как оценивается неопределённость предсказаний?
Модель может быть ненадёжна для молекул, далёких от обучающего распределения. Мы используем Conformal Prediction — метод, дающий статистически строгие предсказательные интервалы без предположений о распределении. При выходе за applicability domain система выдаёт явное предупреждение "low confidence prediction". Мы применяем несколько методов определения applicability domain: Tanimoto similarity к ближайшим соседям, leverage (Williams plot) и расстояние до k-NN в пространстве эмбеддингов.
Что входит в результат
- Обученная модель (формат ONNX или TorchScript)
- REST API с документацией OpenAPI
- Отчёт с метриками (ROC-AUC, PR-AUC, калибровка)
- Анализ области применимости и неопределённости
- Обучение команды работе с моделью
- Гарантийная поддержка 3 месяца
Как мы работаем
- Анализ задач: определяем целевые ADMET-свойства, собираем и чистим датасеты.
- Моделирование: экспериментируем с архитектурами, подбираем гиперпараметры (Weights & Biases).
- Валидация: кросс-валидация, тестирование на held-out сетах, проверка на внешних бенчмарках.
- Интеграция: развёртывание на вашей инфраструктуре (SageMaker, Vertex AI) или on-premise.
- Передача: код, модель, документация, обучение.
Сроки: от 3 недель для одной задачи до 3 месяцев для полноценной multitask-системы. Стоимость рассчитывается индивидуально — свяжитесь с нами, и мы подготовим коммерческое предложение.
Наши компетенции
5+ лет опыта в AI для drug discovery, более 50 реализованных проектов в области молекулярного моделирования. Гарантируем качество и соблюдение сроков. Используем современный стек: PyTorch, Hugging Face Transformers, Chemprop, RDKit, Weights & Biases. Закажите бесплатный анализ ваших данных — мы проверим их пригодность для ADMET-моделирования и предложим оптимальную архитектуру. Получите консультацию прямо сейчас, отправив запрос через форму на сайте.







