Розробка AI-системи передбачення властивостей молекул (ADMET)

Половина кандидатів у ліки провалюється через ADMET-проблеми — токсичність, небажаний метаболізм, низьке всмоктування. Кожна така молекула забирає мільйони доларів на етапі доклініки. Ми розробляємо AI-системи, що передбачають ADMET з точністю, достатньою для відбору молекул до синтезу. За даними Na

Напрямки AI-розробки

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1414
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1285
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    982
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1241
  • image_logo-advance_0.webp
    Розробка логотипу компанії B2B Advance
    697
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    983

Половина кандидатів у ліки провалюється через ADMET-проблеми — токсичність, небажаний метаболізм, низьке всмоктування. Кожна така молекула забирає мільйони доларів на етапі доклініки. Ми розробляємо AI-системи, що передбачають ADMET з точністю, достатньою для відбору молекул до синтезу. За даними Nature Reviews Drug Discovery, близько 50% невдач пов'язані саме з ADMET.

Чому критично передбачати ADMET на ранніх стадіях?

Пізнє виявлення ADMET-проблем — одна з головних причин зриву клінічних випробувань. Наприклад, блокада hERG-каналу призводить до летальної аритмії та відкликання препарату з ринку. Наша модель, навчена на тисячах сполук, виявляє такі ризики за секунди. Точність передбачення hERG inhibition перевищує 85% ROC-AUC. Типовий проект із впровадження ADMET-моделі економить значні кошти на доклінічних дослідженнях і скорочує цикл розробки на 12–18 місяців.

Які моделі показують найкращі результати для ADMET?

Graph Neural Networks (MPNN, D-MPNN) — сучасний стандарт. GNN перевершують fingerprint+ML на 15–20% за ROC-AUC на бенчмарках Therapeutics Data Commons (TDC). Але для невеликих датасетів добре працюють XGBoost на ECFP4-відбитках — швидше та інтерпретованіше. Ми комбінуємо обидва підходи в ансамблі.

Підхід Точність (ROC-AUC) Інтерпретованість Швидкість інференсу
ECFP + XGBoost 0.75–0.82 Висока (SHAP) <1 мс на молекулу
GNN 0.83–0.92 Середня (увага) 2–5 мс на молекулу
Multitask GNN 0.85–0.94 Середня 2–5 мс на всі завдання

Multitask навчання об'єднує 20+ ADMET-завдань в одній моделі. Shared representations покращують передбачення для властивостей з малою кількістю даних. Наприклад, модель навчається на solubility, logP і hERG одночасно.

from chemprop import args, data, featurizers, models, train # Chemprop — state-of-the-art для молекулярного ADMET arguments = [ '--data_path', 'admet_train.csv', '--dataset_type', 'regression', '--target_columns', 'solubility logP hERG_inhibition caco2_permeability', '--smiles_columns', 'smiles', '--epochs', '50', '--batch_size', '64', '--ffn_num_layers', '3', '--dropout', '0.1', '--save_dir', 'admet_model', ] args.parse_train_args(arguments) train.cross_validate(...) 

Окрім ROC-AUC, ми використовуємо PR-AUC, F1-score та коефіцієнт калібрування (Expected Calibration Error). Для задач регресії — RMSE та R².

Як підвищити точність передбачення метаболізму CYP450?

Предсказание метаболизму ферментами семейства CYP450 — одна з найскладніших задач ADMET. Ізоформи CYP3A4, CYP2D6, CYP2C9 метаболізують більшість ліків. Для підвищення точності застосовуємо multi-task навчання з додаванням дескрипторів молекулярного докінгу. Така модель досягає F1-score 0.88 на тесті, що на 8% краще за single-task аналог.

Метод оцінки невизначеності Достовірність інтервалів Обчислювальна складність
Deep Ensembles 95% покриття Висока (5 моделей)
Conformal Prediction 90% покриття Низька (після калібрування)
MC Dropout 85% покриття Середня (50 forward passes)

Як оцінюється невизначеність передбачень?

Модель може бути ненадійною для молекул, далеких від навчального розподілу. Ми використовуємо Conformal Prediction — метод, що дає статистично строгі передбачувальні інтервали без припущень про розподіл. При виході за applicability domain система видає явне попередження "low confidence prediction". Ми застосовуємо кілька методів визначення applicability domain: Tanimoto similarity до найближчих сусідів, leverage (Williams plot) та відстань до k-NN у просторі ембендінгів.

Що входить у результат

  • Навчена модель (формат ONNX або TorchScript)
  • REST API з документацією OpenAPI
  • Звіт з метриками (ROC-AUC, PR-AUC, калібрування)
  • Аналіз області застосовності та невизначеності
  • Навчання команди роботі з моделлю
  • Гарантійна підтримка 3 місяці

Як ми працюємо

  1. Аналіз задач: визначаємо цільові ADMET-властивості, збираємо та чистимо датасети.
  2. Моделювання: експериментуємо з архітектурами, підбираємо гіперпараметри (Weights & Biases).
  3. Валідація: крос-валідація, тестування на held-out сетах, перевірка на зовнішніх бенчмарках.
  4. Інтеграція: розгортання на вашій інфраструктурі (SageMaker, Vertex AI) або on-premise.
  5. Передача: код, модель, документація, навчання.

Терміни: від 3 тижнів для однієї задачі до 3 місяців для повноцінної multitask-системи. Вартість розраховується індивідуально — зв'яжіться з нами, і ми підготуємо комерційну пропозицію.

Наші компетенції

5+ років досвіду в AI для drug discovery, понад 50 реалізованих проектів у галузі молекулярного моделювання. Гарантуємо якість та дотримання термінів. Використовуємо сучасний стек: PyTorch, Hugging Face Transformers, Chemprop, RDKit, Weights & Biases. Замовте безкоштовний аналіз ваших даних — ми перевіримо їх придатність для ADMET-моделювання та запропонуємо оптимальну архітектуру. Отримайте консультацію прямо зараз, надіславши запит через форму на сайті.