Разработка AI-системы виртуального скрининга молекул

Разработка AI-системы виртуального скрининга молекул Virtual Screening

Направления AI-разработки

Часто задаваемые вопросы

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1414
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1285
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    982
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1241
  • image_logo-advance_0.webp
    Разработка логотипа компании B2B Advance
    697
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    983

Разработка AI-системы виртуального скрининга молекул Virtual Screening

Идентификация активных молекул из библиотеки в миллиарды соединений — ключевая задача drug discovery. Классический HTS требует недель и миллионов долларов. AI-виртуальный скрининг Virtual screening меняет правила: мы строим end-to-end системы под ключ, от выбора молекулярных fingerprintов до деплоя на GPU-кластере. В одном из проектов мы за 3 недели нашли 12 активных хитов с hit rate 14% против 0.5% при случайном скрининге, сократив бюджет в 20 раз. Наши решения сокращают время поиска хитов с месяцев до дней — оцените свой проект, свяжитесь с нами.

Опираемся на 10-летний опыт в cheminformatics и MLOps. Гарантируем качество: enrichment factor EF@1% > 50, точность прогноза в рамках доверительных интервалов модели. Для billion-scale скрининга используем распределённую инфраструктуру: GPU-кластеры с 8–32 A100, Triton Inference Server и ONNX Runtime для инференса моделей.

Методы виртуального скрининга

Ligand-based screening (LBVS)

Использует информацию о известных активных молекулах. Если у нас есть набор активных молекул против таргета — ищем похожие.

  • Similarity search: молекулярные fingerprints (Morgan/ECFP, MACCS) + Tanimoto coefficient. Быстро, масштабируется до миллиардов
  • Pharmacophore modeling: выявление ключевых 3D-фармакофорных точек активных молекул → поиск молекул с той же spatial arrangement
  • QSAR (Quantitative Structure-Activity Relationship): ML-модель предсказывает pIC50 по структурным признакам

Structure-based screening (SBVS) Использует 3D-структуру таргетного белка. Молекулы докируются в активный сайт.

Узкое место классического SBVS: докинг 1 молекулы занимает секунды → 1 млрд молекул = 30 лет CPU. AI решения:

  • Surrogate ML-модели: быстрый ML-скоринг (миллисекунды) заменяет докинг как pre-filter
  • Neural Network Potentials для скоринга: более точная оценка связывания
  • Ultra-large scale docking: Glide SP, DOCK6 оптимизированы для 10⁹ масштабов при правильной инфраструктуре

Как AI-скрининг превосходит классический докинг?

Классический докинг (SBVS) — вычислительно дорогой: одна молекула требует секунд CPU. AI-суррогатные модели снижают время до миллисекунд, сохраняя точность. В тестовом проекте мы заменили докинг для pre-filter: скорость выросла в 1000 раз, AUC ROC удержалась на уровне 0,85. Сравнение методов:

Метод Время на 1 млн молекул Точность (AUC)
Классический докинг ~30 дней (CPU) 0,8–0,9
ML-суррогат ~1 час (GPU) 0,75–0,85
Комбинированный funnel ~3 дня (GPU) 0,85–0,95

Ultra-Large Library Screening

Enamine REAL Space: 36 миллиардов synthetically accessible молекул. Эффективная стратегия — иерархический funnel плюс генеративный скрининг.

Молекулярные embeddings

Обучение encoder (Transformer или GNN) для компактного векторного представления молекул. Поиск ближайших соседей в embedding space в миллисекунды. FAISS для индексирования миллиардов векторов.

Генеративный скрининг (make-on-demand)

Вместо скрининга готовой библиотеки — генерация новых молекул с нужными свойствами в пространстве синтетически доступных структур. Reinvent, SAFE (IUPAC), Synthetically Accessible Drug Space.

Иерархическое сужение (funnel approach)

Billion-scale library → Fast ML pre-filter (Tanimoto/embedding): 10⁹ → 10⁶ → QSAR activity filter: 10⁶ → 10⁵ → Fast docking: 10⁵ → 10⁴ → Accurate docking (Glide XP): 10⁴ → 10³ → FEP calculation: 10³ → 100 → Synthesis & experimental validation: ~50 

Каждый уровень: более медленный, но более точный метод. Throughput каждого уровня подобран к пропускной способности следующего.

Пример реализации funnel pipeline на практике В реальном проекте для фармкомпании мы использовали: pre-filter по Tanimoto на 10⁸ молекул, затем QSAR модель LightGBM, затем Glide SP на 10⁵, затем Glide XP на 10⁴. Полный цикл: 3 дня на 32 A100. Hit rate в финале: 8%.

Почему активное обучение эффективнее случайного скрининга?

Традиционный VS: случайная выборка для тестирования. Active Learning (активное обучение) — ML-модель выбирает, какие молекулы наиболее информативны для следующей итерации экспериментов.

Цикл:

  1. Инициальный датасет (1000 молекул с измеренной активностью)
  2. Обучение суррогатной модели
  3. Acquisition function выбирает следующие 100 молекул (Expected Improvement, UCB)
  4. Синтез + тест
  5. Повторить

Результат: сокращение числа необходимых синтезов в 5–20 раз для нахождения активных хитов по сравнению с random screening. В одном из проектов мы достигли hit rate 12% при active learning против 1% при random — экономия бюджета в 10 раз.

Метрики эффективности скрининга

Метрика Описание
Enrichment Factor (EF) Во сколько раз активных молекул больше в топ-X%, чем в случайной выборке
AUC (ROC) Дискриминация активных / неактивных
BEDROC Взвешенная метрика с упором на top hits
Hit Rate % активных среди синтезированных кандидатов

Цель: EF@1% > 50 (в топ 1% молекул в 50 раз больше активных, чем в случайной выборке).

Инфраструктура для billion-scale скрининга: GPU-кластер (8–32 A100), distributed inference с Ray или Dask, object storage для молекулярных данных. Полный скрининг 1B молекул: 24–72 часа в зависимости от глубины анализа.

Что входит в разработку AI-системы скрининга?

Каждый проект включает:

  • Анализ данных и выбор молекулярных репрезентаций (fingerprints, embeddings)
  • Построение и обучение суррогатных моделей (QSAR, GNN, Transformer)
  • Проектирование funnel pipeline с учётом вычислительных ресурсов
  • Деплой на GPU-инфраструктуре (Triton Inference Server, ONNX Runtime)
  • Интеграция с базами данных (PostgreSQL + pgvector для embeddings)
  • Документация, обучение команды, поддержка на этапе эксплуатации

Сроки: от 4 недель для базового proof-of-concept до 3 месяцев для полноценной production-системы. Стоимость рассчитывается индивидуально — оценим ваш проект при обращении.

Мы гарантируем воспроизводимость результатов и предоставляем сертификаты качества модели. Опыт — 30+ проектов в drug discovery, 5+ лет на рынке AI/ML. Закажите разработку AI-системы виртуального скрининга и получите консультацию наших инженеров.