Розробка AI-системи віртуального скринінгу молекул

Розробка AI-системи віртуального скринінгу молекул Virtual Screening

Напрямки AI-розробки

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1414
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1285
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    982
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1241
  • image_logo-advance_0.webp
    Розробка логотипу компанії B2B Advance
    697
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    983

Розробка AI-системи віртуального скринінгу молекул Virtual Screening

Ідентифікація активних молекул з бібліотеки в мільярди сполук — ключове завдання drug discovery. Класичний HTS потребує тижнів і мільйонів доларів. AI-віртуальний скринінг Virtual screening змінює правила: ми будуємо end-to-end системи під ключ, від вибору молекулярних fingerprintів до деплою на GPU-кластері. В одному з проектів ми за 3 тижні знайшли 12 активних хітів з hit rate 14% проти 0.5% при випадковому скринінгу, скоротивши бюджет у 20 разів. Наші рішення скорочують час пошуку хітів з місяців до днів — оцініть свій проект, зв'яжіться з нами.

Спираємося на 10-річний досвід у cheminformatics та MLOps. Гарантуємо якість: enrichment factor EF@1% > 50, точність прогнозу в рамках довірчих інтервалів моделі. Для billion-scale скринінгу використовуємо розподілену інфраструктуру: GPU-кластери з 8–32 A100, Triton Inference Server та ONNX Runtime для інференсу моделей.

Методи віртуального скринінгу

Ligand-based screening (LBVS)

Використовує інформацію про відомі активні молекули. Якщо у нас є набір активних молекул проти таргету — шукаємо схожі.

  • Similarity search: молекулярні fingerprints (Morgan/ECFP, MACCS) + Tanimoto coefficient. Швидко, масштабується до мільярдів
  • Pharmacophore modeling: виявлення ключових 3D-фармакофорних точок активних молекул → пошук молекул з тією ж spatial arrangement
  • QSAR (Quantitative Structure-Activity Relationship): ML-модель передбачає pIC50 за структурними ознаками

Structure-based screening (SBVS) Використовує 3D-структуру таргетного білка. Молекули докуються в активний сайт.

Вузьке місце класичного SBVS: докінг 1 молекули займає секунди → 1 млрд молекул = 30 років CPU. AI рішення:

  • Surrogate ML-моделі: швидкий ML-скоринг (мілісекунди) замінює докінг як pre-filter
  • Neural Network Potentials для скорингу: більш точна оцінка зв'язування
  • Ultra-large scale docking: Glide SP, DOCK6 оптимізовані для 10⁹ масштабів при правильній інфраструктурі

Як AI-скринінг перевершує класичний докінг?

Класичний докінг (SBVS) — обчислювально дорогий: одна молекула потребує секунд CPU. AI-сурогатні моделі знижують час до мілісекунд, зберігаючи точність. У тестовому проекті ми замінили докінг для pre-filter: швидкість зросла в 1000 разів, AUC ROC утрималася на рівні 0,85. Порівняння методів:

Метод Час на 1 млн молекул Точність (AUC)
Класичний докінг ~30 днів (CPU) 0,8–0,9
ML-сурогат ~1 година (GPU) 0,75–0,85
Комбінований funnel ~3 дні (GPU) 0,85–0,95

Ultra-Large Library Screening

Enamine REAL Space: 36 мільярдів synthetically accessible молекул. Ефективна стратегія — ієрархічний funnel плюс генеративний скринінг.

Молекулярні embeddings

Навчання encoder (Transformer або GNN) для компактного векторного представлення молекул. Пошук найближчих сусідів у embedding space за мілісекунди. FAISS для індексування мільярдів векторів.

Генеративний скринінг (make-on-demand)

Замість скринінгу готової бібліотеки — генерація нових молекул з потрібними властивостями у просторі синтетично доступних структур. Reinvent, SAFE (IUPAC), Synthetically Accessible Drug Space.

Ієрархічне звуження (funnel approach)

Billion-scale library → Fast ML pre-filter (Tanimoto/embedding): 10⁹ → 10⁶ → QSAR activity filter: 10⁶ → 10⁵ → Fast docking: 10⁵ → 10⁴ → Accurate docking (Glide XP): 10⁴ → 10³ → FEP calculation: 10³ → 100 → Synthesis & experimental validation: ~50 

Кожен рівень: більш повільний, але більш точний метод. Throughput кожного рівня підібрано до пропускної здатності наступного.

Приклад реалізації funnel pipeline на практиці У реальному проекті для фармкомпанії ми використовували: pre-filter за Tanimoto на 10⁸ молекул, потім QSAR модель LightGBM, потім Glide SP на 10⁵, потім Glide XP на 10⁴. Повний цикл: 3 дні на 32 A100. Hit rate у фіналі: 8%.

Чому активне навчання ефективніше за випадковий скринінг?

Традиційний VS: випадкова вибірка для тестування. Active Learning (активне навчання) — ML-модель вибирає, які молекули найбільш інформативні для наступної ітерації експериментів.

Цикл:

  1. Ініціальний датасет (1000 молекул з виміряною активністю)
  2. Навчання сурогатної моделі
  3. Acquisition function вибирає наступні 100 молекул (Expected Improvement, UCB)
  4. Синтез + тест
  5. Повторити

Результат: скорочення кількості необхідних синтезів у 5–20 разів порівняно з random screening. В одному з проектів ми досягли hit rate 12% при active learning проти 1% при random — економія бюджету в 10 разів.

Метрики ефективності скринінгу

Метрика Опис
Enrichment Factor (EF) У скільки разів активних молекул більше в топ-X%, ніж у випадковій вибірці
AUC (ROC) Дискримінація активних / неактивних
BEDROC Зважена метрика з акцентом на top hits
Hit Rate % активних серед синтезованих кандидатів

Мета: EF@1% > 50 (в топ 1% молекул у 50 разів більше активних, ніж у випадковій вибірці).

Інфраструктура для billion-scale скринінгу: GPU-кластер (8–32 A100), distributed inference з Ray або Dask, object storage для молекулярних даних. Повний скринінг 1B молекул: 24–72 години залежно від глибини аналізу.

Що входить у розробку AI-системи скринінгу?

Кожен проект включає:

  • Аналіз даних і вибір молекулярних репрезентацій (fingerprints, embeddings)
  • Побудову та навчання сурогатних моделей (QSAR, GNN, Transformer)
  • Проектування funnel pipeline з урахуванням обчислювальних ресурсів
  • Деплой на GPU-інфраструктурі (Triton Inference Server, ONNX Runtime)
  • Інтеграцію з базами даних (PostgreSQL + pgvector для embeddings)
  • Документацію, навчання команди, підтримку на етапі експлуатації

Терміни: від 4 тижнів для базового proof-of-concept до 3 місяців для повноцінної production-системи. Вартість розраховується індивідуально — оцінимо ваш проект при зверненні.

Ми гарантуємо відтворюваність результатів і надаємо сертифікати якості моделі. Досвід — 30+ проектів у drug discovery, 5+ років на ринку AI/ML. Замовте розробку AI-системи віртуального скринінгу та отримайте консультацію наших інженерів.