ML-система кредитного скорингу: впровадження під ключ

Уявіть: банк втрачає мільйони через невірні кредитні рішення. Традиційні скорингові карти на основі логістичної регресії не справляються з нелінійними залежностями в даних. Сучасні градієнтні моделі, такі як XGBoost, у 2-3 рази точніші за логістичну регресію, що підтверджується численними кейсами. П

Напрямки AI-розробки

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1440
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    997
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1264
  • image_logo-advance_0.webp
    Розробка логотипу компанії B2B Advance
    712
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    1002

Уявіть: банк втрачає мільйони через невірні кредитні рішення. Традиційні скорингові карти на основі логістичної регресії не справляються з нелінійними залежностями в даних. Сучасні градієнтні моделі, такі як XGBoost, у 2-3 рази точніші за логістичну регресію, що підтверджується численними кейсами. Приклад: один із клієнтів, що використовує лінійну модель, втрачав 5% хороших позичальників через невірне відхилення. Ми вирішуємо цю проблему за допомогою градієнтного бустингу та глибокого навчання. Машинне навчання у фінансах — наш профіль. Ми будуємо ML-моделі, які аналізують сотні факторів і дають точні прогнози дефолту. Підвищення Gini на 10 в.п. економить банку до 10 млн грн на портфелі в 5 млрд.

Ми впроваджуємо ML-системи кредитного скорингу під ключ, які замінюють застарілі логістичні регресії. Наш досвід показує: сучасні моделі з сотнями ознак підвищують Gini на 8–15 в.п. порівняно з традиційними підходами. Різниця в 8 в.п. Gini — це мільйони гривень річної економії для середнього банку.

Постановка задачі та дані

Цільова змінна: дефолт протягом 12 місяців (бінарна класифікація) або ймовірність дефолту для PD оцінки в рамках Basel III. Клас-імбланс: типічно 1:10–1:50 (дефолтні vs. нормальні), що потребує особливої уваги. Оцінка кредитоспроможності позичальників базується на різнорідних даних.

Джерела ознак:

Джерело Тип ознак Значущість
Кредитна історія (БКІ) Прострочки, кількість кредитів, запити Висока
Транзакційні дані Патерни витрат, залишки, регулярність Висока
Демографія Вік, регіон, зайнятість Середня
Телеком-дані Регулярність поповнення, роумінг Середня
Поведінкові Час заповнення анкети, пристрій Низька-середня

Як ML-система кредитного скорингу підвищує точність?

XGBoost скоринг є основою наших рішень. XGBoost / LightGBM — основна робоча конячка. Обробляє табличні дані, нечутливий до викидів, добре працює з пропусками, інтерпретований через SHAP. LightGBM кредитний ризик моделюється з високою точністю. Для більшості задач скорингу — оптимальний вибір.

CatBoost — перевага при великій кількості категоріальних ознак (регіон, професія) без ручного кодування.

Нейромережі (TabNet, AutoInt) — дають приріст на дуже великих датасетах (>5M записів) з багатими поведінковими даними. Складніші в інтерпретації та обслуговуванні.

Стекінг. У production часто використовуємо ансамбль: LightGBM + logistic regression (для інтерпретованості regulatory reporting) з мета-лірнером.

Глибокий розбір: робота з імблансом та calibration

Precision 0.71 при recall 0.89 на класі "default" через дисбаланс 1:25 — стандартна біль скорингових моделей. На практиці ефективні:

Focal Loss. Для нейромережевих моделей значно краще простого weighted cross-entropy. Параметр gamma=2 фокусує навчання на складних прикладах, як описано в роботі Lin et al. (2017).

SMOTE обережно. Oversample + undersample працює, але SMOTE на фінансових даних може створювати нереалістичні синтетичні приклади — обов'язково валідувати бізнес-логікою.

Calibration критична. Модель видає score, але нам потрібна реальна ймовірність дефолту для розрахунку LGD та EAD. Isotonic regression або Platt scaling після навчання. Перевіряємо calibration curve — ідеальна модель: передбачена ймовірність 0.3 = 30% фактичних дефолтів.

from sklearn.calibration import CalibratedClassifierCV from lightgbm import LGBMClassifier base_model = LGBMClassifier( n_estimators=500, learning_rate=0.05, scale_pos_weight=25, # співвідношення класів min_child_samples=50 ) calibrated_model = CalibratedClassifierCV( base_model, method='isotonic', cv=5 ) calibrated_model.fit(X_train, y_train) 

Чому важливий моніторинг дрейфу даних?

Скорингова модель деградує з часом. Причини: зміна економічної ситуації, зміна кредитної політики банку, зміна поведінки позичальників.

Обов'язковий моніторинг:

  • PSI (Population Stability Index) за вхідними ознаками: PSI > 0.25 — критична зміна розподілу, потрібне перенавчання.
  • Gini на hold-out вибірці щомісячно.
  • Score distribution shift: якщо середній score популяції зсунувся на >15 пунктів — перевіряємо причини.
  • Outcome monitoring: через 6–12 місяців порівнюємо передбачений vs. фактичний дефолт rate.
Метрика Дія
PSI > 0.25 Перенавчання моделі
Gini впав > 3 в.п. Уточнення ознак / повторний тюнінг
Score shift > 15 Перевірка дрейфу популяції
Деталі регуляторних вимог В Україні кредитний скоринг регулюється НБУ. Ключові вимоги: інтерпретованість рішень по відмовах (SHAP інтерпретація), можливість оскаржити рішення, заборона на використання низки ознак (дискримінаційних). GDPR-аналог — ЗУ «Про захист персональних даних» — вимагає обґрунтування автоматичних рішень. Ми маємо 5 років досвіду та понад 50 успішних проєктів у фінансовому секторі. Гарантуємо якість моделі та супровід протягом 3 місяців після впровадження.

Що входить в роботу по впровадженню ML-скорингу?

  • Аналітичний звіт з описом джерел даних, feature engineering та обраної архітектури моделі.
  • Навчена та відкалібрована модель (артефакт у форматі .pkl або .onnx) з метриками на відкладеній вибірці.
  • REST API на FastAPI для отримання скорів у реальному часі, контейнеризований у Docker.
  • Документація: опис моделі (model card), інструкція з експлуатації, API-специфікація (OpenAPI).
  • Навчання команди замовника: воркшоп з SHAP інтерпретації та моніторингу дрейфу.
  • Підтримка протягом 3 місяців після запуску (консультації, виправлення помилок).

Як ми впроваджуємо ML-скоринг?

  1. Аналіз даних та feature engineering. Аудит джерел, очищення, генерація 100+ ознак. Використовуємо PySpark для обробки великих обсягів.
  2. Вибір та навчання моделі. Підбір алгоритму (LightGBM, XGBoost, нейромережі) та гіперпараметрів через Optuna. Валідація на часових зрізах.
  3. Калібрування та інтерпретація. Platt scaling або ізотонічна регресія. SHAP-звіти для бізнесу та регулятора.
  4. Розгортання та моніторинг. REST API на FastAPI, контейнеризація Docker, моніторинг PSI та Gini.
  5. Документування та compliance. Звіт для НБУ, опис моделі, навчання команди.

Практичний кейс

Наш клієнт — МФО, вихідна модель — логрег з 18 ознаками з БКІ. Gini = 0.52 на тестовій вибірці. Ми виконали:

  • Додали 140 транзакційних ознак (патерни витрат, cash-in/out ratio, регулярність).
  • LightGBM з hyperparameter tuning через Optuna (300 trials).
  • Feature selection: залишили топ-80 ознак за SHAP importance.
  • Calibration: Platt scaling для отримання реальних PD (PD оцінка).
  • Підсумок: Gini на тестовій вибірці — 0.71 (+19 в.п.). Approval rate при тому ж рівні дефолтності виріс на 12% (схвалюємо більше хороших позичальників). Приріст схвалення дав додатковий дохід 15 мільйонів гривень на рік.

Строки: 8–12 тижнів для базової ML-моделі, 4–6 місяців для production-системи з моніторингом, інтерпретованістю та compliance. Гарантуємо якість. Пишіть нам для консультації — оцінимо ваш проект безкоштовно. Замовте пілотний проєкт — отримайте готову модель через 2 тижні. Звертайтеся до нас для впровадження ML-скорингу у вашому банку.