Чому більшість AI-моделей прогнозування цін зазнають невдачі?
Трейдери та фонди часто вкладають ресурси в розробку складних моделей, але на реальних ринках вони показують збитки. Причина — в трьох пастках: look-ahead bias, ігнорування транзакційних витрат і перенавчання на історичних даних. Наприклад, проста модель на ковзних середніх може показувати Sharpe ratio 1.5 в backtest, але в live-торгівлі без урахування slippage та комісій цей показник падає до 0.3. Ми вже стикалися з проєктами, де модель з IC 0.08 на валідації показувала Sharpe 0.2 в продакшні — через ігнорування slippage. Наш підхід виключає такі сюрпризи. Ми вирішуємо ці проблеми через purged walk-forward валідацію, реалістичну transaction cost model (Almgren-Chriss) та строгий контроль вибору факторів.
Як вибрати горизонт прогнозування?
Практична мета — не точна ціна через N днів, а сигнал з позитивним очікуваним значенням після транзакційних витрат. Навіть модель з MAPE 3% на акціях S&P500 некорисна, якщо Sharpe ratio стратегії < 0. Горизонт визначає тип сигналу:
- Intraday (хвилини-години): microstructure signals, order flow imbalance — типова дохідність 0.5–1.5% на угоду.
- Short-term (1-5 днів): momentum, mean reversion — середній IC 0.05–0.08.
- Medium-term (1-4 тижні): earnings, macro catalysts — IC може досягати 0.12.
- Long-term (місяці): fundamental valuation, factor exposure — більш стабільний, але вимагає більшої точності.
Оптимальний горизонт залежить від ліквідності інструмента та частоти ребалансування. Для менш ліквідних активів короткі горизонти менш надійні.
Що таке purged walk-forward валідація?
Коректна валідація — ключ до реалістичного backtest. Використовуємо purged walk-forward cross-validation:
- Training: t=0 до t=T
- Purge gap: T до T+embargo (усуваємо look-ahead з overlapping labels)
- Test: T+embargo до T+embargo+H
- Embargo period: зазвичай дорівнює горизонту прогнозу
Embargo period гарантує, що інформація з майбутнього не просочиться в навчальну вибірку. Це критично важливо для часових рядів. Метрики: IC (Information Coefficient) — кореляція передбачених та реальних рангів дохідності. IC > 0.05 — слабкий, IC > 0.10 — хороший. ICIR (IC Information Ratio) — стабільність сигналу. Sharpe ratio стратегії з сигналу — головна практична метрика. Efficient Market Hypothesis стверджує, що ринки ефективні, але на практиці мікроаномалії існують, і їх можна виявити за допомогою коректної валідації.
Для вибору моделі враховуйте обсяг та структуру даних: якщо інструментів багато — LightGBM ранжування, якщо один часовий ряд — LSTM, якщо мульти-інструменти з відомими подіями — Temporal Fusion Transformer. При обмежених даних починайте з LightGBM.
Особливості та архітектура моделі
Price-based (технічний аналіз):
- Returns: log returns за 1, 5, 10, 21 торговий день.
- Momentum: 12-1 month momentum (Jegadeesh-Titman factor).
- RSI, MACD, Bollinger Band width — осцилятори як функції від ціни.
- Volatility: realized volatility за 5/21/63 днів.
Volume-based:
- Volume relative to 20-day average.
- Price × Volume (долар-обсяг).
- On-Balance Volume (OBV).
- VWAP deviation.
Fundamental (для акцій):
- P/E, P/B, EV/EBITDA.
- EPS growth YoY.
- Revenue growth.
- Debt/Equity.
Alternative data:
- Sentiment з Twitter/Reddit (NLP score).
- Google Trends для consumer stocks.
- Satellite imagery (retail parking lots, commodity stores).
- Job postings growth (Glassdoor, LinkedIn).
Порівняння основних підходів до моделювання:
| Модель | Сильні сторони | Слабкості | Застосування |
|---|---|---|---|
| LightGBM (ranking) | Швидка, інтерпретована, стійка до перенавчання | Не працює з послідовностями | Cross-sectional ranking, large universe |
| LSTM | Вловлює часові залежності | Довго навчається, потрібна очистка даних | Один інструмент, часові ряди |
| Temporal Fusion Transformer | Враховує future covariates, multi-horizon | Складність налаштування | Багато інструментів з відомими подіями |
LightGBM навчається в 10 разів швидше LSTM на табличних даних — це перевага для швидкого прототипування. Для ranking задач використовуємо LGBMRanker з objective='lambdarank'. Приклад конфігурації:
import lightgbm as lgb model = lgb.LGBMRanker( objective='lambdarank', n_estimators=500, learning_rate=0.05, max_depth=6 ) Для часових рядів одного інструмента застосовуємо LSTM з 60 днями історії:
model = Sequential([ LSTM(64, return_sequences=True, input_shape=(60, n_features)), Dropout(0.2), LSTM(32), Dropout(0.2), Dense(1) ]) Temporal Fusion Transformer — найкращий вибір при наявності known future covariates (дати earnings, macro events) та 100+ інструментів.
Якість моделі оцінюється не тільки за IC. Використовуємо комплекс метрик:
| Метрика | Хороше значення | Інтерпретація |
|---|---|---|
| Information Coefficient | > 0.05 | Кореляція передбачень з реальністю |
| ICIR | > 0.5 | Стабільність сигналу |
| Sharpe ratio (after TC) | > 1.0 | Ефективність стратегії |
| Win rate | > 55% | Частка прибуткових угод |
З моделі в торгову стратегію
Модель → сигнал → позиція → PnL — ланцюжок з кількома етапами втрат:
- Signal generation: score ранжування по universe акцій (зазвичай 500-1000 інструментів).
- Portfolio construction: mean-variance optimization (Markowitz) або equal-weight децилі. Типова кількість позицій 20-50.
- Risk управління: обмеження на sector/factor exposure, max position size 5%.
- Transaction cost model: bid-ask spread + market impact (Almgren-Chriss) — урахування slippage, часто 10-30 bps.
- Backtesting: з реальними TC та slippage — ключове! Використовуємо Zipline / Backtrader або кастомний backtester.
Поширені помилки: survivorship bias (навчання тільки на існуючих акціях), look-ahead bias в фундаментальних даних (використовуємо point-in-time), ігнорування transaction costs. Ми документуємо кожне припущення.
Що входить в роботу
- Документація: дашборд з метриками (IC, Sharpe), опис моделі, код відтворення.
- Доступ до моделі: REST API або Python-пакет з документацією.
- Навчання команди: воркшоп з експлуатації та донавчання.
- Підтримка: 3 місяці після впровадження, включаючи моніторинг дрейфу.
Отримайте консультацію інженера по вашому проєкту — ми безкоштовно оцінимо дані та терміни.
Наші результати
Ми створили моделі для кількох хедж-фондів та проп-трейдингових команд. Середня економія на транзакційних витратах становить 20-30% порівняно з наївними бенчмарками. Гарантуємо IC > 0.05 на out-of-sample, Sharpe ratio > 1.0 після TC. Маємо сертифікати AWS та GCP з ML. Досвід роботи з LightGBM та PyTorch. Зв'яжіться з нами для оцінки вашого проєкту — розрахуємо терміни та вартість безкоштовно.







