Реализация прогнозирования временных рядов (Time Series Forecasting)

Реализация прогнозирования временных рядов (Time Series Forecasting)

Направления AI-разработки

Часто задаваемые вопросы

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1440
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    997
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1264
  • image_logo-advance_0.webp
    Разработка логотипа компании B2B Advance
    712
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    1002

Реализация прогнозирования временных рядов (Time Series Forecasting)

Мы регулярно сталкиваемся с ситуацией, когда данные — продажи, IoT-датчики или биржевые котировки — содержат временные зависимости, которые легко нарушить неверным обращением. Неправильный split или игнорирование сезонности приводят к data leakage и ложно-оптимистичным результатам на backtest. Например, в одном проекте по прогнозированию спроса на запчасти seasonal naive давал MAPE 40%, а Prophet — 28%, но только после walk-forward валидации выяснилось, что Prophet на 10% хуже на последних трёх месяцах. За несколько лет реальных проектов мы реализовали более 20 систем прогнозирования и выработали robust-методологию, которой делимся ниже. Для каждой задачи подбираем стек: от классических SARIMA до современных Transformer-архитектур, учитывая бюджет и требования к интерпретируемости. Получите консультацию по вашему проекту — мы проанализируем данные и предложим roadmap за 2–3 дня.

Классификация временных рядов

Перед выбором метода — анализ свойств ряда:

  • Стационарность: ADF-тест (Augmented Dickey-Fuller). Нестационарные ряды требуют дифференцирования или специальных методов.
  • Сезонность: ACF/PACF анализ. Одиночная (недельная) или множественная (недельная + годовая) сезонность влияет на выбор модели.
  • Прерывистость (intermittency): ADI (Average Demand Interval) > 1.32 — специальные методы (Croston, IMAPA).
  • Нелинейность: тест Teräsvirta / BDS-тест. Линейные модели (ARIMA) неадекватны при сильной нелинейности.

Как выбрать модель для временного ряда?

Универсального ответа нет — мы сравниваем кандидатов на исторических данных. Вот типичные варианты с их trade-off:

  • Naive / Seasonal Naive — простейший baseline для проверки, что сложные методы действительно лучше.
  • ETS (Exponential Smoothing) с автоматическим подбором — хорошо работает на рядах с одиночной сезонностью, но не поддерживает множественные сезонности.
  • SARIMA — классика с доверительными интервалами, но медленная при большом числе наблюдений.
  • Prophet — удобен для бизнес-данных с праздниками, интерпретируем, но проигрывает нейросетям на сложных паттернах.
  • LightGBM с лагами — даёт высокую точность при множестве внешних факторов, но требует инженерной работы над фичами.
  • N-BEATS / N-HiTS — SOTA на соревнованиях M4/M5, работают без внешних фич, но остаются чёрным ящиком.
  • Temporal Fusion Transformer — лидер для ансамблей множества рядов, но требователен к GPU и данным.
  • TimesGPT / TimesFM — foundation-модели для zero-shot прогноза, ускоряют старт, но дороги и менее контролируемы.

Правильный бэктестинг

Проблема: стандартный train/test split нарушает temporal ordering. Walk-Forward Validation:

|---Train---| Test | |----Train----| Test | |-----Train-----| Test | Average metrics across all windows 

Размер тестового окна = прогнозный горизонт. Шаг сдвига = горизонт / 2 или = горизонт (без overlap).

Data leakage sources:

  • Использование будущих данных в scaling (fit scaler на всём датасете)
  • Target encoding с будущими значениями
  • External features с будущей информацией (known future covariates vs. past covariates)

Почему walk-forward валидация обязательна?

Без неё любая метрика на тесте будет оптимистичной. Мы гарантируем, что все модели проходят временной split без overlap. В проектах используем библиотеку statsforecast с автоматическим подбором окна. Это единственный способ получить реалистичную оценку качества и избежать переплаты за ложные ожидания.

Feature Engineering для ML-подхода

Временны́е features:

df['hour'] = df.index.hour df['day_of_week'] = df.index.dayofweek df['week_of_year'] = df.index.isocalendar().week df['month'] = df.index.month df['is_weekend'] = df['day_of_week'].isin([5, 6]).astype(int) # Cyclical encoding df['sin_hour'] = np.sin(2 * np.pi * df['hour'] / 24) df['cos_hour'] = np.cos(2 * np.pi * df['hour'] / 24) 

Lag features: t-1, t-7, t-14, t-28 для дневных данных; t-1, t-24, t-168 для почасовых.

Rolling statistics: среднее, std, min, max за 7/28/90 дней. Разности: (t-1) - (t-7) для захвата тренда.

Probabilistic Forecasting

Точечный прогноз без неопределённости — недостаточно для бизнес-решений. Квантильные прогнозы:

  • Quantile Regression: LightGBM с objective='quantile', alpha=0.1/0.5/0.9
  • Conformal Prediction: теоретически обоснованные интервалы, не предполагают распределение
  • Monte Carlo Dropout: в нейросетях — ensemble через dropout в inference
  • N-HiTS с квантилями: нативная поддержка в библиотеке neuralforecast
Подробнее о квантильных прогнозах

Квантильный прогноз даёт интервал [P10, P90] вместо точечного значения. Это позволяет бизнесу оценить риски: например, заложить бюджет не по среднему, а по P90. Мы всегда включаем квантили в продакшен-системы.

Production Pipeline

# Пример с Nixtla / statsforecast from statsforecast import StatsForecast from statsforecast.models import AutoARIMA, AutoETS, AutoTheta models = [AutoARIMA(season_length=7), AutoETS(season_length=7), AutoTheta()] sf = StatsForecast(models=models, freq='D', n_jobs=-1) sf.fit(train_df) forecasts = sf.predict(h=28, level=[80, 95]) 

MLflow tracking: каждый эксперимент — версия данных, гиперпараметры, метрики, артефакт модели. Scheduling: Airflow DAG для ежедневного переобучения и публикации прогнозов в Data Warehouse.

Мониторинг: Evidently для отслеживания data drift входных фич и prediction drift выхода модели.

Сравнение подходов к валидации

Метод валидации Применение Особенности
Hold-out (train/test) Быстрый baseline Рвёт временну́ю структуру, data leakage
Walk-forward с overlap Рекомендуется Честная оценка, итеративное обучение
Rolling window (без overlap) Альтернатива Меньше тестовых окон, быстрее
Timeseries CV (например, Blocked CV) Библиотеки scikit-learn Удобно, но часто игнорирует сезонность

Мы используем walk-forward с overlap, так как он даёт наиболее стабильные метрики и соответствует продакшен-нагрузке.

Сравнение моделей по критериям

Модель Точность (MAPE) Интерпретируемость Поддержка множественной сезонности Время обучения
Prophet Средняя Высокая Частично Быстро
N-BEATS Высокая Низкая Да Средне
LightGBM Высокая Средняя Нет (требуются лаги) Быстро
TFT Очень высокая Низкая Да Долго (GPU)

Пошаговый план внедрения системы прогнозирования

  1. Анализ исходных данных и выявление закономерностей (стационарность, сезонность, прерывистость).
  2. Выбор baseline и 3–5 кандидатов (от простых до сложных).
  3. Walk-forward валидация каждой модели и сравнение по метрикам (MAPE, RMSE, MASE).
  4. Разработка production pipeline: версионирование экспериментов в MLflow, оркестрация в Airflow, мониторинг дрейфа в Evidently.
  5. Интеграция прогнозов в Data Warehouse и настройка алертов при отклонениях.

Сроки: от 2–3 недель для baseline до 8–12 недель для полной системы с квантилями и дрифт-мониторингом. Стоимость рассчитывается индивидуально — свяжитесь с нами для оценки вашего проекта. Для получения детального коммерческого предложения оставьте заявку.

Опыт нашей команды — более 20 реализованных проектов, среднее снижение MAPE на 15–30% после настройки модели. Обращайтесь — оценим ваш временной ряд, подберём стек и подготовим roadmap за 2–3 дня.