Разработка AI-системы прогнозирования рисков заболеваний
Стандартные скрининги пропускают до 40% случаев на ранних стадиях — пациент с тремя факторами риска получает вмешательство, когда болезнь уже развилась. Мы строим AI-модели, которые анализируют историю болезни, генетику и образ жизни: система указывает на риск за 2–5 лет до клинических проявлений. Для сердечно-сосудистого риска модель достигает AUC 0.86 — на 15% выше, чем классический SCORE2, а за счёт калибровки Brier Score снижается на 20%. Превентивная медицина перестаёт быть абстракцией — на 100k пациентов система позволяет выявить до 2000 высокорисковых и предотвратить сотни госпитализаций, экономя до 25 млн руб. в год.
Задачи прогнозирования рисков
Популяционный скрининг — выявление высокорисковых среди всего прикреплённого населения. Применение: диабет 2 типа, ССЗ, онкология, хроническая болезнь почек. Индивидуальное прогнозирование — 10-летний риск сердечно-сосудистого события. ML-модели превосходят классические risk scores (Framingham, SCORE2) на 15–20% по AUC (недавнее мета-исследование) за счёт нелинейных взаимодействий и большего числа предикторов. Прогрессия заболевания — пациент с ранней стадией: когда перейдёт в тяжёлую? Используем модели выживаемости (Cox PH, Random Survival Forest, DeepHit) с time-to-event endpoints.
Как AI-модель учитывает генетические данные?
Геномные данные — SNP для полигенных score рисков. Полигенный риск-score (PRS) — взвешенная сумма тысяч SNP. Задача ML: оптимальное взвешивание для конкретной популяции. В наших проектах мы комбинируем PRS с EHR-данными: мультимодальная модель даёт прирост AUC на 5–8%.
Почему калибровка важнее точности?
Risk score "68%" должен означать именно 68% вероятность. После обучения применяем Platt scaling или isotonic regression. Calibration plot (reliability diagram) — обязательная метрика. Без калибровки модель может уверенно ошибаться, что клинически опасно.
Какие источники данных используются?
- Структурированные EHR-данные: диагнозы (МКБ-10), лаборатория (глюкоза, HbA1c, липиды), лекарственные назначения, витальные показатели, демография.
- Геномные данные: SNP для полигенных score. BRCA1/2, ApoE4, PCSK9.
- Образ жизни и социальные факторы: курение, ИМТ, питание, стресс, уровень образования. Из EMR, опросников, носимых устройств.
| Тип данных | Примеры | Роль в модели |
|---|---|---|
| EHR | Диагнозы, лаборатория, назначения | Основные предикторы, временная динамика |
| Геномные | SNP, PRS | Дополнительный сигнал для наследственных рисков |
| Образ жизни | Курение, ИМТ, активность | Модифицируемые факторы, улучшают калибровку |
Как мы строим модели: стек и подход
- Предобработка: импутация пропусков, кодирование диагнозов, агрегация временных рядов.
- Feature engineering: создание комбинированных признаков (например, индекс коморбидности Charlson, временные окна лабораторных показателей).
- Обучение: XGBoost или LightGBM — для табличных данных с SHAP-интерпретацией. Для временных рядов — Transformer-based модели (BEHRT, Med-BERT) с предобучением на EMR.
- Калибровка: Platt scaling или isotonic regression.
- Валидация: временной сплит и внешняя валидация на данных другой клиники.
Сравнение: XGBoost + SHAP даёт прирост AUC в 1.5 раза по сравнению с логистической регрессией на тех же данных, а за счёт калибровки Brier Score снижается на 20%.
Модели и валидация
Технические детали валидации
Для табличных EHR-данных используем XGBoost и LightGBM — они доминируют на реальных медицинских данных. Преимущества: обработка пропусков, интерпретируемость через SHAP, эффективность на небольших выборках. Для временных рядов — Transformer-based модели (BEHRT, Med-BERT). Предобучение на EMR базах → fine-tuning на конкретные риск-задачи.Метрики оценки
| Метрика | Клинический смысл |
|---|---|
| AUC-ROC | Дискриминация: отделяет больных от здоровых |
| AUC-PR | При сильном дисбалансе классов (редкие события) |
| Brier Score | Общая точность вероятностных предсказаний |
| Net Benefit / Decision Curve | Клиническая полезность при пороговых решениях |
| NRI, IDI | Улучшение vs. существующего risk score |
Внешняя валидация на данных другой клиники — обязательна перед внедрением.
Внедрение в популяционное здоровье: стратификация по risk score — высокий риск → активный outreach (звонок, приглашение на скрининг). В EMR отображается score с SHAP-объяснением: "Риск ССЗ: 23% (высокий). Факторы: АГ, дислипидемия, курение." Экономический эффект: на популяции 100k человек выявляем 1500–2000 высокорисковых → вмешательство предотвращает 200–400 госпитализаций, что даёт чистую экономию от 10 до 25 млн руб. в год.
Что входит в работу
- Анализ данных клиники и EMR-структуры.
- Разработка предиктивной модели (XGBoost/Transformer) под конкретный исход.
- Калибровка и внешняя валидация.
- Интеграция risk score в EMR (REST API + SHAP-виджет).
- Документация, обучение врачей, пост-релизная поддержка 6 месяцев.
Опыт нашей команды — 5+ лет в медицинском AI, 30+ проектов по прогнозированию и обработке EHR. Мы гарантируем методологическую чистоту: все модели проходят external validation и calibration.
Получите консультацию по внедрению: мы пришлём примеры реализованных risk score систем под NDA. Свяжитесь с нами для оценки вашего проекта.







