Розробка AI-системи для аналізу чеків покупців

Розробка AI-системи для аналізу чеків покупців

Напрямки AI-розробки

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1441
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1302
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    998
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1267
  • image_logo-advance_0.webp
    Розробка логотипу компанії B2B Advance
    714
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    1006

Розробка AI-системи для аналізу чеків покупців

Покупець виходить з магазину, пробиває чек через додаток ФНС — і більше про нього ні даних, ні інсайтів. Роздрібна мережа втрачає granular data: що куплено, коли, з чим. Ми перетворюємо мільйони неструктурованих чеків на actionable insight для зростання LTV та оптимізації асортименту. Система аналізує кошик, передбачає відтік і підказує персоналізовані пропозиції — без ручної обробки. Замовте пілотний проект для вашої мережі.

Джерела даних чеків

Джерело Формат Особливості Точність data completeness
Мобільний додаток JSON (API ФНС) Низький % транзакцій, але висока якість 60–70%
Програма лояльності XML/CSV Повний охоплення по ідентифікованим клієнтам 95%+
ОФД (оператор фіскальних даних) JSON (API) Потокова передача, 100% чеків, але без ідентифікації клієнта 99.9%
Кабінет платника податків JSON (API ФНС) Тільки чеки фізичних осіб, юридичні не потрапляють 50–80%

Структура даних чека

Фіскальний чек в Росії має стандартизований формат (ФФД 1.05/1.1):

class Receipt(BaseModel): receipt_id: str fiscal_number: str date_time: datetime store_name: str store_inn: str cashier: str | None items: list[ReceiptItem] total_amount: Decimal payment_type: str # наличные / карта / QR class ReceiptItem(BaseModel): name: str # наименование товара quantity: float price: Decimal amount: Decimal product_code: str | None # штрихкод 
Деталі ETL-пайплайнаДані з усіх джерел агрегуються в Apache Airflow. Дедуплікація за fiscal_number та receipt_id. Пропущені атрибути (наприклад, product_code) відновлюються через fuzzy matching з каталогом товарів. Навантаження пайплайна витримує до 10 млн чеків на добу.

Як нормалізувати товарні найменування з хаосу?

Найменування товарів у чеках — хаос: «МОЛ.ПАСТ.2,5% 1кг», «Молоко паст. 2,5% т/п 1л», «МОЛОКО ДОМИК 2.5 1Л» — одне й те саме. Нормалізація через LLM дає >98% точності для частотних товарів, але латентність висока. Для масової обробки ми навчаємо BERT-класифікатор на нормалізованому корпусі — inference в 100× швидше за LLM. Модель розгортається в ONNX Runtime для інференсу на CPU з latency p99 < 50 мс.

def normalize_product_name(raw_name: str) -> NormalizedProduct: return llm.parse(f"""Нормалізуй назву товару з касового чека. Витягни: категорію, бренд, об'єм/вагу, жирність (для молочних). Сировий назва: {raw_name}""", response_format=NormalizedProduct ) 

Чому моделям Apriori та FP-Growth не вистачає для прогнозу?

Класичні алгоритми, такі як Apriori та FP-Growth, знаходять статичні асоціації, але не враховують сезонність, тренди та цінову еластичність. Ми комбінуємо FP-Growth з градієнтним бустингом (CatBoost) на ознаках: день тижня, промо-акції, погода. Це підвищує lift рекомендацій на 15–20% порівняно з pure association rules. Згідно зі звітом Gartner, впровадження такої гібридної аналітики збільшує LTV на 20%.

Аналітика на основі чеків включає:

  • Basket analysis: FP-Growth з фільтрацією за support 0.01% та confidence 20%.
  • Customer lifetime value: BG/NBD модель з прогнозом транзакцій на 12 тижнів.
  • Price elasticity: бандитські алгоритми (Thompson Sampling) для A/B-тестів знижок.
  • Category management: динаміка share of wallet за категоріями з сезонною декомпозицією.
  • Churn prediction: градієнтний бустинг на фічах: частота покупок, сума чека, категорійне різноманіття. ROC-AUC > 0.85.

Порівняння підходів до basket analysis

Підхід Продуктивність Врахування трендів Lift
Apriori Повільний на великих даних Ні 1.0x
FP-Growth Швидкий, але без динаміки Ні 1.0x
FP-Growth + CatBoost Помірний Так (температура, промо) 1.2x

Візуалізація: Superset з дашбордами для retail-аналітиків без SQL — готові метрики по брендах, категоріях, когортах. Економія від персоналізації асортименту може досягати 15% виручки.

Що входить в роботу

При замовленні системи ви отримуєте:

  • Архітектурну документацію пайплайнів та моделей.
  • Налаштовані дашборди в Superset з ключовими метриками.
  • Навчання 2–3 співробітників роботі з системою.
  • Підтримку протягом 1 місяця після запуску: моніторинг дрейфу моделей, налаштування alerts.

Які етапи включає впровадження системи?

  1. ETL-пайплайн для чеків з ОФД, мобільного додатку та програми лояльності (Apache Airflow, Kafka – опціонально).
  2. ML-моделі нормалізації, категоризації, прогнозування (PyTorch, Hugging Face Transformers, CatBoost).
  3. Дашборди в Superset/Metabase: KPI по продажах, кошику, асортименту, відтоку.
  4. Навчання команди (2–3 співробітники) та документація архітектури.
  5. Підтримка 1 місяць після запуску: моніторинг дрейфу моделей, налаштування alerts.

Зв'яжіться з нами – оцінимо ваш проект за 2 робочих дні. Отримайте консультацію щодо термінів та складу робіт. Підберемо рішення під ваш масштаб.

Наш досвід та гарантії

Багаторічний досвід в retail (від продуктових мереж до DIY). Гарантуємо дотримання NDA та відповідність 152-ФЗ. Маємо сертифікати з PyTorch та MLflow. Можемо підписати SLA на uptime моделей 99.9%.