Разработка AI-системы предсказания свойств молекул (ADMET)

Половина кандидатов в лекарства проваливается из-за ADMET-проблем — токсичности, нежелательного метаболизма, низкого всасывания. Каждая такая молекула отнимает миллионы долларов на этапе доклиники. Мы разрабатываем AI-системы, предсказывающие ADMET с точностью, достаточной для отбора молекул до синт

Направления AI-разработки

Часто задаваемые вопросы

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1414
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1285
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    982
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1241
  • image_logo-advance_0.webp
    Разработка логотипа компании B2B Advance
    697
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    983

Половина кандидатов в лекарства проваливается из-за ADMET-проблем — токсичности, нежелательного метаболизма, низкого всасывания. Каждая такая молекула отнимает миллионы долларов на этапе доклиники. Мы разрабатываем AI-системы, предсказывающие ADMET с точностью, достаточной для отбора молекул до синтеза. По данным Nature Reviews Drug Discovery, около 50% неудач связаны именно с ADMET.

Почему критично предсказывать ADMET на ранних стадиях?

Позднее обнаружение ADMET-проблем — одна из главных причин срыва клинических испытаний. Например, блокада hERG-канала ведёт к летальной аритмии и отзыву препарата с рынка. Наша модель, обученная на тысячах соединений, выявляет такие риски за секунды. Точность предсказания hERG inhibition превышает 85% ROC-AUC. Типичный проект по внедрению ADMET-модели экономит значительные средства на доклинических исследованиях и сокращает цикл разработки на 12–18 месяцев.

Какие модели показывают лучшие результаты для ADMET?

Graph Neural Networks (MPNN, D-MPNN) — современный стандарт. GNN превосходят fingerprint+ML на 15–20% по ROC-AUC на бенчмарках Therapeutics Data Commons (TDC). Но для небольших датасетов хорошо работают XGBoost на ECFP4-отпечатках — быстрее и интерпретируемее. Мы комбинируем оба подхода в ансамбле.

Подход Точность (ROC-AUC) Интерпретируемость Скорость инференса
ECFP + XGBoost 0.75–0.82 Высокая (SHAP) <1 мс на молекулу
GNN 0.83–0.92 Средняя (внимание) 2–5 мс на молекулу
Multitask GNN 0.85–0.94 Средняя 2–5 мс на все задачи

Multitask обучение объединяет 20+ ADMET-задач в одной модели. Shared representations улучшают предсказание для свойств с малым количеством данных. Например, модель обучается на solubility, logP и hERG одновременно.

from chemprop import args, data, featurizers, models, train # Chemprop — state-of-the-art для молекулярного ADMET arguments = [ '--data_path', 'admet_train.csv', '--dataset_type', 'regression', '--target_columns', 'solubility logP hERG_inhibition caco2_permeability', '--smiles_columns', 'smiles', '--epochs', '50', '--batch_size', '64', '--ffn_num_layers', '3', '--dropout', '0.1', '--save_dir', 'admet_model', ] args.parse_train_args(arguments) train.cross_validate(...) 

Помимо ROC-AUC, мы используем PR-AUC, F1-score и коэффициент калибровки (Expected Calibration Error). Для задач регрессии — RMSE и R².

Как повысить точность предсказания метаболизма CYP450?

Предсказание метаболизма ферментами семейства CYP450 — одна из сложнейших задач ADMET. Изоформы CYP3A4, CYP2D6, CYP2C9 метаболизируют большинство лекарств. Для повышения точности применяем multi-task обучение с добавлением дескрипторов молекулярного докинга. Такая модель достигает F1-score 0.88 на тесте, что на 8% лучше single-task аналога.

Метод оценки неопределённости Достоверность интервалов Вычислительная сложность
Deep Ensembles 95% покрытие Высокая (5 моделей)
Conformal Prediction 90% покрытие Низкая (после калибровки)
MC Dropout 85% покрытие Средняя (50 forward passes)

Как оценивается неопределённость предсказаний?

Модель может быть ненадёжна для молекул, далёких от обучающего распределения. Мы используем Conformal Prediction — метод, дающий статистически строгие предсказательные интервалы без предположений о распределении. При выходе за applicability domain система выдаёт явное предупреждение "low confidence prediction". Мы применяем несколько методов определения applicability domain: Tanimoto similarity к ближайшим соседям, leverage (Williams plot) и расстояние до k-NN в пространстве эмбеддингов.

Что входит в результат

  • Обученная модель (формат ONNX или TorchScript)
  • REST API с документацией OpenAPI
  • Отчёт с метриками (ROC-AUC, PR-AUC, калибровка)
  • Анализ области применимости и неопределённости
  • Обучение команды работе с моделью
  • Гарантийная поддержка 3 месяца

Как мы работаем

  1. Анализ задач: определяем целевые ADMET-свойства, собираем и чистим датасеты.
  2. Моделирование: экспериментируем с архитектурами, подбираем гиперпараметры (Weights & Biases).
  3. Валидация: кросс-валидация, тестирование на held-out сетах, проверка на внешних бенчмарках.
  4. Интеграция: развёртывание на вашей инфраструктуре (SageMaker, Vertex AI) или on-premise.
  5. Передача: код, модель, документация, обучение.

Сроки: от 3 недель для одной задачи до 3 месяцев для полноценной multitask-системы. Стоимость рассчитывается индивидуально — свяжитесь с нами, и мы подготовим коммерческое предложение.

Наши компетенции

5+ лет опыта в AI для drug discovery, более 50 реализованных проектов в области молекулярного моделирования. Гарантируем качество и соблюдение сроков. Используем современный стек: PyTorch, Hugging Face Transformers, Chemprop, RDKit, Weights & Biases. Закажите бесплатный анализ ваших данных — мы проверим их пригодность для ADMET-моделирования и предложим оптимальную архитектуру. Получите консультацию прямо сейчас, отправив запрос через форму на сайте.