Почему большинство AI-моделей прогнозирования цен терпят неудачу?
Трейдеры и фонды часто вкладывают ресурсы в разработку сложных моделей, но на реальных рынках они показывают убытки. Причина — в трёх ловушках: look-ahead bias, игнорирование транзакционных издержек и переобучение на исторических данных. Например, простая модель на скользящих средних может показывать Sharpe ratio 1.5 в backtest, но в live-торговле без учёта slippage и комиссий этот показатель падает до 0.3. Мы уже сталкивались с проектами, где модель с IC 0.08 на валидации показывала Sharpe 0.2 в продакшне — из-за игнорирования slippage. Наш подход исключает такие сюрпризы. Мы решаем эти проблемы через purged walk-forward валидацию, реалистичную transaction cost model (Almgren-Chriss) и строгий контроль выбора факторов.
Как выбрать горизонт прогнозирования?
Практическая цель — не точная цена через N дней, а сигнал с положительным ожидаемым значением после транзакционных издержек. Даже модель с MAPE 3% на акциях S&P500 бесполезна, если Sharpe ratio стратегии < 0. Горизонт определяет тип сигнала:
- Intraday (минуты-часы): microstructure signals, order flow imbalance — типичная доходность 0.5–1.5% на сделку.
- Short-term (1-5 дней): momentum, mean reversion — средний IC 0.05–0.08.
- Medium-term (1-4 недели): earnings, macro catalysts — IC может достигать 0.12.
- Long-term (месяцы): fundamental valuation, factor exposure — более стабильный, но требует большей точности.
Оптимальный горизонт зависит от ликвидности инструмента и частоты ребалансировки. Для менее ликвидных активов короткие горизонты менее надёжны.
Что такое purged walk-forward валидация?
Корректная валидация — ключ к реалистичному backtest. Используем purged walk-forward cross-validation:
- Training: t=0 до t=T
- Purge gap: T до T+embargo (устраняем look-ahead из overlapping labels)
- Test: T+embargo до T+embargo+H
- Embargo period: обычно равен горизонту прогноза
Embargo period гарантирует, что информация из будущего не просочится в обучающую выборку. Это критически важно для временных рядов. Метрики: IC (Information Coefficient) — корреляция предсказанных и реальных рангов доходности. IC > 0.05 — слабый, IC > 0.10 — хороший. ICIR (IC Information Ratio) — стабильность сигнала. Sharpe ratio стратегии из сигнала — главная практическая метрика. Efficient Market Hypothesis утверждает, что рынки эффективны, но на практике микроаномалии существуют, и их можно выявить с помощью корректной валидации.
Для выбора модели учитывайте объём и структуру данных: если инструментов много — LightGBM ранжирование, если один временной ряд — LSTM, если мульти-инструменты с известными событиями — Temporal Fusion Transformer. При ограниченных данных начинайте с LightGBM.
Особенности и архитектура модели
Price-based (технический анализ):
- Returns: log returns за 1, 5, 10, 21 торговый день.
- Momentum: 12-1 month momentum (Jegadeesh-Titman factor).
- RSI, MACD, Bollinger Band width — осцилляторы как функции от цены.
- Volatility: realized volatility за 5/21/63 дней.
Volume-based:
- Volume relative to 20-day average.
- Price × Volume (доллар-объём).
- On-Balance Volume (OBV).
- VWAP deviation.
Fundamental (для акций):
- P/E, P/B, EV/EBITDA.
- EPS growth YoY.
- Revenue growth.
- Debt/Equity.
Alternative data:
- Sentiment из Twitter/Reddit (NLP score).
- Google Trends для consumer stocks.
- Satellite imagery (retail parking lots, commodity stores).
- Job postings growth (Glassdoor, LinkedIn).
Сравнение основных подходов к моделированию:
| Модель | Сильные стороны | Слабости | Применение |
|---|---|---|---|
| LightGBM (ranking) | Быстрая, интерпретируемая, устойчива к переобучению | Не работает с последовательностями | Cross-sectional ranking, large universe |
| LSTM | Улавливает временные зависимости | Долго обучается, нужна очистка данных | Один инструмент, временные ряды |
| Temporal Fusion Transformer | Учитывает future covariates, multi-horizon | Сложность настройки | Много инструментов с известными событиями |
LightGBM обучается в 10 раз быстрее LSTM на табличных данных — это преимущество для быстрого прототипирования. Для ranking задач используем LGBMRanker с objective='lambdarank'. Пример конфигурации:
import lightgbm as lgb model = lgb.LGBMRanker( objective='lambdarank', n_estimators=500, learning_rate=0.05, max_depth=6 ) Для временных рядов одного инструмента применяем LSTM с 60 днями истории:
model = Sequential([ LSTM(64, return_sequences=True, input_shape=(60, n_features)), Dropout(0.2), LSTM(32), Dropout(0.2), Dense(1) ]) Temporal Fusion Transformer — лучший выбор при наличии known future covariates (даты earnings, macro events) и 100+ инструментов.
Качество модели оценивается не только по IC. Используем комплекс метрик:
| Метрика | Хорошее значение | Интерпретация |
|---|---|---|
| Information Coefficient | > 0.05 | Корреляция предсказаний с реальностью |
| ICIR | > 0.5 | Стабильность сигнала |
| Sharpe ratio (after TC) | > 1.0 | Эффективность стратегии |
| Win rate | > 55% | Доля прибыльных сделок |
Из модели в торговую стратегию
Модель → сигнал → позиция → PnL — цепочка с несколькими этапами потерь:
- Signal generation: score ранжирования по universe акций (обычно 500-1000 инструментов).
- Portfolio construction: mean-variance optimization (Markowitz) или equal-weight децили. Типичное количество позиций 20-50.
- Risk управление: ограничения на sector/factor exposure, max position size 5%.
- Transaction cost model: bid-ask spread + market impact (Almgren-Chriss) — учёт slippage, часто 10-30 bps.
- Backtesting: с реальными TC и slippage — ключевое! Используем Zipline / Backtrader или кастомный backtester.
Распространённые ошибки: survivorship bias (обучение только на существующих акциях), look-ahead bias в фундаментальных данных (используем point-in-time), игнорирование transaction costs. Мы документируем каждое допущение.
Что входит в работу
- Документация: дашборд с метриками (IC, Sharpe), описание модели, код воспроизведения.
- Доступ к модели: REST API или Python-пакет с документацией.
- Обучение команды: воркшоп по эксплуатации и дообучению.
- Поддержка: 3 месяца после внедрения, включая мониторинг дрейфа.
Получите консультацию инженера по вашему проекту — мы бесплатно оценим данные и сроки.
Наши результаты
Мы создали модели для нескольких хедж-фондов и проп-трейдинговых команд. Средняя экономия на транзакционных издержках составляет 20-30% по сравнению с наивными бенчмарками. Гарантируем IC > 0.05 на out-of-sample, Sharpe ratio > 1.0 после TC. Имеем сертификаты AWS и GCP по ML. Опыт работы с LightGBM и PyTorch. Свяжитесь с нами для оценки вашего проекта — рассчитаем сроки и стоимость бесплатно.







