Розробка AI-системи віртуального скринінгу молекул Virtual Screening
Ідентифікація активних молекул з бібліотеки в мільярди сполук — ключове завдання drug discovery. Класичний HTS потребує тижнів і мільйонів доларів. AI-віртуальний скринінг Virtual screening змінює правила: ми будуємо end-to-end системи під ключ, від вибору молекулярних fingerprintів до деплою на GPU-кластері. В одному з проектів ми за 3 тижні знайшли 12 активних хітів з hit rate 14% проти 0.5% при випадковому скринінгу, скоротивши бюджет у 20 разів. Наші рішення скорочують час пошуку хітів з місяців до днів — оцініть свій проект, зв'яжіться з нами.
Спираємося на 10-річний досвід у cheminformatics та MLOps. Гарантуємо якість: enrichment factor EF@1% > 50, точність прогнозу в рамках довірчих інтервалів моделі. Для billion-scale скринінгу використовуємо розподілену інфраструктуру: GPU-кластери з 8–32 A100, Triton Inference Server та ONNX Runtime для інференсу моделей.
Методи віртуального скринінгу
Ligand-based screening (LBVS)
Використовує інформацію про відомі активні молекули. Якщо у нас є набір активних молекул проти таргету — шукаємо схожі.
- Similarity search: молекулярні fingerprints (Morgan/ECFP, MACCS) + Tanimoto coefficient. Швидко, масштабується до мільярдів
- Pharmacophore modeling: виявлення ключових 3D-фармакофорних точок активних молекул → пошук молекул з тією ж spatial arrangement
- QSAR (Quantitative Structure-Activity Relationship): ML-модель передбачає pIC50 за структурними ознаками
Structure-based screening (SBVS) Використовує 3D-структуру таргетного білка. Молекули докуються в активний сайт.
Вузьке місце класичного SBVS: докінг 1 молекули займає секунди → 1 млрд молекул = 30 років CPU. AI рішення:
- Surrogate ML-моделі: швидкий ML-скоринг (мілісекунди) замінює докінг як pre-filter
- Neural Network Potentials для скорингу: більш точна оцінка зв'язування
- Ultra-large scale docking: Glide SP, DOCK6 оптимізовані для 10⁹ масштабів при правильній інфраструктурі
Як AI-скринінг перевершує класичний докінг?
Класичний докінг (SBVS) — обчислювально дорогий: одна молекула потребує секунд CPU. AI-сурогатні моделі знижують час до мілісекунд, зберігаючи точність. У тестовому проекті ми замінили докінг для pre-filter: швидкість зросла в 1000 разів, AUC ROC утрималася на рівні 0,85. Порівняння методів:
| Метод | Час на 1 млн молекул | Точність (AUC) |
|---|---|---|
| Класичний докінг | ~30 днів (CPU) | 0,8–0,9 |
| ML-сурогат | ~1 година (GPU) | 0,75–0,85 |
| Комбінований funnel | ~3 дні (GPU) | 0,85–0,95 |
Ultra-Large Library Screening
Enamine REAL Space: 36 мільярдів synthetically accessible молекул. Ефективна стратегія — ієрархічний funnel плюс генеративний скринінг.
Молекулярні embeddings
Навчання encoder (Transformer або GNN) для компактного векторного представлення молекул. Пошук найближчих сусідів у embedding space за мілісекунди. FAISS для індексування мільярдів векторів.
Генеративний скринінг (make-on-demand)
Замість скринінгу готової бібліотеки — генерація нових молекул з потрібними властивостями у просторі синтетично доступних структур. Reinvent, SAFE (IUPAC), Synthetically Accessible Drug Space.
Ієрархічне звуження (funnel approach)
Billion-scale library → Fast ML pre-filter (Tanimoto/embedding): 10⁹ → 10⁶ → QSAR activity filter: 10⁶ → 10⁵ → Fast docking: 10⁵ → 10⁴ → Accurate docking (Glide XP): 10⁴ → 10³ → FEP calculation: 10³ → 100 → Synthesis & experimental validation: ~50 Кожен рівень: більш повільний, але більш точний метод. Throughput кожного рівня підібрано до пропускної здатності наступного.
Приклад реалізації funnel pipeline на практиці
У реальному проекті для фармкомпанії ми використовували: pre-filter за Tanimoto на 10⁸ молекул, потім QSAR модель LightGBM, потім Glide SP на 10⁵, потім Glide XP на 10⁴. Повний цикл: 3 дні на 32 A100. Hit rate у фіналі: 8%.Чому активне навчання ефективніше за випадковий скринінг?
Традиційний VS: випадкова вибірка для тестування. Active Learning (активне навчання) — ML-модель вибирає, які молекули найбільш інформативні для наступної ітерації експериментів.
Цикл:
- Ініціальний датасет (1000 молекул з виміряною активністю)
- Навчання сурогатної моделі
- Acquisition function вибирає наступні 100 молекул (Expected Improvement, UCB)
- Синтез + тест
- Повторити
Результат: скорочення кількості необхідних синтезів у 5–20 разів порівняно з random screening. В одному з проектів ми досягли hit rate 12% при active learning проти 1% при random — економія бюджету в 10 разів.
Метрики ефективності скринінгу
| Метрика | Опис |
|---|---|
| Enrichment Factor (EF) | У скільки разів активних молекул більше в топ-X%, ніж у випадковій вибірці |
| AUC (ROC) | Дискримінація активних / неактивних |
| BEDROC | Зважена метрика з акцентом на top hits |
| Hit Rate | % активних серед синтезованих кандидатів |
Мета: EF@1% > 50 (в топ 1% молекул у 50 разів більше активних, ніж у випадковій вибірці).
Інфраструктура для billion-scale скринінгу: GPU-кластер (8–32 A100), distributed inference з Ray або Dask, object storage для молекулярних даних. Повний скринінг 1B молекул: 24–72 години залежно від глибини аналізу.
Що входить у розробку AI-системи скринінгу?
Кожен проект включає:
- Аналіз даних і вибір молекулярних репрезентацій (fingerprints, embeddings)
- Побудову та навчання сурогатних моделей (QSAR, GNN, Transformer)
- Проектування funnel pipeline з урахуванням обчислювальних ресурсів
- Деплой на GPU-інфраструктурі (Triton Inference Server, ONNX Runtime)
- Інтеграцію з базами даних (PostgreSQL + pgvector для embeddings)
- Документацію, навчання команди, підтримку на етапі експлуатації
Терміни: від 4 тижнів для базового proof-of-concept до 3 місяців для повноцінної production-системи. Вартість розраховується індивідуально — оцінимо ваш проект при зверненні.
Ми гарантуємо відтворюваність результатів і надаємо сертифікати якості моделі. Досвід — 30+ проектів у drug discovery, 5+ років на ринку AI/ML. Замовте розробку AI-системи віртуального скринінгу та отримайте консультацію наших інженерів.







