Розробка AI-системи для аналізу чеків покупців
Покупець виходить з магазину, пробиває чек через додаток ФНС — і більше про нього ні даних, ні інсайтів. Роздрібна мережа втрачає granular data: що куплено, коли, з чим. Ми перетворюємо мільйони неструктурованих чеків на actionable insight для зростання LTV та оптимізації асортименту. Система аналізує кошик, передбачає відтік і підказує персоналізовані пропозиції — без ручної обробки. Замовте пілотний проект для вашої мережі.
Джерела даних чеків
| Джерело | Формат | Особливості | Точність data completeness |
|---|---|---|---|
| Мобільний додаток | JSON (API ФНС) | Низький % транзакцій, але висока якість | 60–70% |
| Програма лояльності | XML/CSV | Повний охоплення по ідентифікованим клієнтам | 95%+ |
| ОФД (оператор фіскальних даних) | JSON (API) | Потокова передача, 100% чеків, але без ідентифікації клієнта | 99.9% |
| Кабінет платника податків | JSON (API ФНС) | Тільки чеки фізичних осіб, юридичні не потрапляють | 50–80% |
Структура даних чека
Фіскальний чек в Росії має стандартизований формат (ФФД 1.05/1.1):
class Receipt(BaseModel): receipt_id: str fiscal_number: str date_time: datetime store_name: str store_inn: str cashier: str | None items: list[ReceiptItem] total_amount: Decimal payment_type: str # наличные / карта / QR class ReceiptItem(BaseModel): name: str # наименование товара quantity: float price: Decimal amount: Decimal product_code: str | None # штрихкод Деталі ETL-пайплайна
Дані з усіх джерел агрегуються в Apache Airflow. Дедуплікація за fiscal_number та receipt_id. Пропущені атрибути (наприклад, product_code) відновлюються через fuzzy matching з каталогом товарів. Навантаження пайплайна витримує до 10 млн чеків на добу.Як нормалізувати товарні найменування з хаосу?
Найменування товарів у чеках — хаос: «МОЛ.ПАСТ.2,5% 1кг», «Молоко паст. 2,5% т/п 1л», «МОЛОКО ДОМИК 2.5 1Л» — одне й те саме. Нормалізація через LLM дає >98% точності для частотних товарів, але латентність висока. Для масової обробки ми навчаємо BERT-класифікатор на нормалізованому корпусі — inference в 100× швидше за LLM. Модель розгортається в ONNX Runtime для інференсу на CPU з latency p99 < 50 мс.
def normalize_product_name(raw_name: str) -> NormalizedProduct: return llm.parse(f"""Нормалізуй назву товару з касового чека. Витягни: категорію, бренд, об'єм/вагу, жирність (для молочних). Сировий назва: {raw_name}""", response_format=NormalizedProduct ) Чому моделям Apriori та FP-Growth не вистачає для прогнозу?
Класичні алгоритми, такі як Apriori та FP-Growth, знаходять статичні асоціації, але не враховують сезонність, тренди та цінову еластичність. Ми комбінуємо FP-Growth з градієнтним бустингом (CatBoost) на ознаках: день тижня, промо-акції, погода. Це підвищує lift рекомендацій на 15–20% порівняно з pure association rules. Згідно зі звітом Gartner, впровадження такої гібридної аналітики збільшує LTV на 20%.
Аналітика на основі чеків включає:
- Basket analysis: FP-Growth з фільтрацією за support 0.01% та confidence 20%.
- Customer lifetime value: BG/NBD модель з прогнозом транзакцій на 12 тижнів.
- Price elasticity: бандитські алгоритми (Thompson Sampling) для A/B-тестів знижок.
- Category management: динаміка share of wallet за категоріями з сезонною декомпозицією.
- Churn prediction: градієнтний бустинг на фічах: частота покупок, сума чека, категорійне різноманіття. ROC-AUC > 0.85.
Порівняння підходів до basket analysis
| Підхід | Продуктивність | Врахування трендів | Lift |
|---|---|---|---|
| Apriori | Повільний на великих даних | Ні | 1.0x |
| FP-Growth | Швидкий, але без динаміки | Ні | 1.0x |
| FP-Growth + CatBoost | Помірний | Так (температура, промо) | 1.2x |
Візуалізація: Superset з дашбордами для retail-аналітиків без SQL — готові метрики по брендах, категоріях, когортах. Економія від персоналізації асортименту може досягати 15% виручки.
Що входить в роботу
При замовленні системи ви отримуєте:
- Архітектурну документацію пайплайнів та моделей.
- Налаштовані дашборди в Superset з ключовими метриками.
- Навчання 2–3 співробітників роботі з системою.
- Підтримку протягом 1 місяця після запуску: моніторинг дрейфу моделей, налаштування alerts.
Які етапи включає впровадження системи?
- ETL-пайплайн для чеків з ОФД, мобільного додатку та програми лояльності (Apache Airflow, Kafka – опціонально).
- ML-моделі нормалізації, категоризації, прогнозування (PyTorch, Hugging Face Transformers, CatBoost).
- Дашборди в Superset/Metabase: KPI по продажах, кошику, асортименту, відтоку.
- Навчання команди (2–3 співробітники) та документація архітектури.
- Підтримка 1 місяць після запуску: моніторинг дрейфу моделей, налаштування alerts.
Зв'яжіться з нами – оцінимо ваш проект за 2 робочих дні. Отримайте консультацію щодо термінів та складу робіт. Підберемо рішення під ваш масштаб.
Наш досвід та гарантії
Багаторічний досвід в retail (від продуктових мереж до DIY). Гарантуємо дотримання NDA та відповідність 152-ФЗ. Маємо сертифікати з PyTorch та MLflow. Можемо підписати SLA на uptime моделей 99.9%.







