Розробка AI-системи прогнозування ризиків захворювань
Стандартні скринінги пропускають до 40% випадків на ранніх стадіях — пацієнт із трьома факторами ризику отримує втручання, коли хвороба вже розвинулася. Ми будуємо AI-моделі, які аналізують історію хвороби, генетику та спосіб життя: система вказує на ризик за 2–5 років до клінічних проявів. Для серцево-судинного ризику модель досягає AUC 0.86 — на 15% вище, ніж класичний SCORE2, а за рахунок калібрування Brier Score знижується на 20%. Превентивна медицина перестає бути абстракцією — на 100 тис. пацієнтів система дозволяє виявити до 2000 високоризикових і запобігти сотням госпіталізацій, заощаджуючи до 25 млн руб. на рік.
Завдання прогнозування ризиків
Популяційний скринінг — виявлення високоризикових серед усього прикріпленого населення. Застосування: діабет 2 типу, ССЗ, онкологія, хронічна хвороба нирок. Індивідуальне прогнозування — 10-річний ризик серцево-судинної події. ML-моделі перевершують класичні risk scores (Framingham, SCORE2) на 15–20% за AUC (недавнє мета-дослідження) за рахунок нелінійних взаємодій і більшої кількості предикторів. Прогресія захворювання — пацієнт із ранньою стадією: коли перейде у важку? Використовуємо моделі виживаності (Cox PH, Random Survival Forest, DeepHit) з time-to-event endpoints.
Як AI-модель враховує генетичні дані?
Геномні дані — SNP для полігенних score ризиків. Полігенний ризик-score (PRS) — зважена сума тисяч SNP. Завдання ML: оптимальне зважування для конкретної популяції. У наших проектах ми комбінуємо PRS з EHR-даними: мультимодальна модель дає приріст AUC на 5–8%.
Чому калібрування важливіше за точність?
Risk score "68%" має означати саме 68% ймовірність. Після навчання застосовуємо Platt scaling або isotonic regression. Calibration plot (reliability diagram) — обов'язкова метрика. Без калібрування модель може впевнено помилятися, що клінічно небезпечно.
Які джерела даних використовуються?
- Структуровані EHR-дані: діагнози (МКХ-10), лабораторія (глюкоза, HbA1c, ліпіди), лікарські призначення, вітальні показники, демографія.
- Геномні дані: SNP для полігенних score. BRCA1/2, ApoE4, PCSK9.
- Спосіб життя та соціальні фактори: куріння, ІМТ, харчування, стрес, рівень освіти. З EMR, опитувальників, носимих пристроїв.
| Тип даних | Приклади | Роль у моделі |
|---|---|---|
| EHR | Діагнози, лабораторія, призначення | Основні предиктори, часова динаміка |
| Геномні | SNP, PRS | Додатковий сигнал для спадкових ризиків |
| Спосіб життя | Куріння, ІМТ, активність | Модифіковані фактори, покращують калібрування |
Як ми будуємо моделі: стек і підхід
- Попередня обробка: імпутація пропусків, кодування діагнозів, агрегація часових рядів.
- Feature engineering: створення комбінованих ознак (наприклад, індекс коморбідності Charlson, часові вікна лабораторних показників).
- Навчання: XGBoost або LightGBM — для табличних даних із SHAP-інтерпретацією. Для часових рядів — Transformer-based моделі (BEHRT, Med-BERT) з переднавчанням на EMR.
- Калібрування: Platt scaling або isotonic regression.
- Валідація: часовий спліт і зовнішня валідація на даних іншої клініки.
Порівняння: XGBoost + SHAP дає приріст AUC в 1.5 рази порівняно з логістичною регресією на тих самих даних, а за рахунок калібрування Brier Score знижується на 20%.
Моделі та валідація
Технічні деталі валідації
Для табличних EHR-даних використовуємо XGBoost і LightGBM — вони домінують на реальних медичних даних. Переваги: обробка пропусків, інтерпретованість через SHAP, ефективність на невеликих вибірках. Для часових рядів — Transformer-based моделі (BEHRT, Med-BERT). Переднавчання на EMR базах → fine-tuning на конкретні ризик-завдання.Метрики оцінки
| Метрика | Клінічний сенс |
|---|---|
| AUC-ROC | Дискримінація: відділяє хворих від здорових |
| AUC-PR | При сильному дисбалансі класів (рідкісні події) |
| Brier Score | Загальна точність імовірнісних передбачень |
| Net Benefit / Decision Curve | Клінічна корисність при порогових рішеннях |
| NRI, IDI | Покращення vs. існуючого risk score |
Зовнішня валідація на даних іншої клініки — обов'язкова перед впровадженням.
Впровадження в популяційне здоров'я: стратифікація за risk score — високий ризик → активний outreach (дзвінок, запрошення на скринінг). В EMR відображається score з SHAP-поясненням: "Ризик ССЗ: 23% (високий). Фактори: АГ, дисліпідемія, куріння." Економічний ефект: на популяції 100 тис. осіб виявляємо 1500–2000 високоризикових → втручання запобігає 200–400 госпіталізацій, що дає чисту економію від 10 до 25 млн руб. на рік.
Що входить у роботу
- Аналіз даних клініки та EMR-структури.
- Розробка предиктивної моделі (XGBoost/Transformer) під конкретний результат.
- Калібрування та зовнішня валідація.
- Інтеграція risk score в EMR (REST API + SHAP-віджет).
- Документація, навчання лікарів, пост-релізна підтримка 6 місяців.
Досвід нашої команди — 5+ років у медичному AI, 30+ проектів з прогнозування та обробки EHR. Ми гарантуємо методологічну чистоту: всі моделі проходять external validation і calibration.
Отримайте консультацію з впровадження: ми надішлемо приклади реалізованих risk score систем під NDA. Зв'яжіться з нами для оцінки вашого проекту.







