Кастомний аналіз тональності тексту (Sentiment Analysis)

Уявіть: ви отримуєте 10 000 відгуків на день, і 30% з них містять сарказм. Звичайна модель класифікує їх як нейтральні, маскуючи негатив. Результат — спотворена картина репутації, втрачені інсайти. Ми стикалися з цим у рітейлі, фінансах та телекомі. Рішення — кастомна система аналізу тональності, ад

Напрямки AI-розробки

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1439
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    997
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1264
  • image_logo-advance_0.webp
    Розробка логотипу компанії B2B Advance
    712
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    1002

Уявіть: ви отримуєте 10 000 відгуків на день, і 30% з них містять сарказм. Звичайна модель класифікує їх як нейтральні, маскуючи негатив. Результат — спотворена картина репутації, втрачені інсайти. Ми стикалися з цим у рітейлі, фінансах та телекомі. Рішення — кастомна система аналізу тональності, адаптована під ваш домен. Вона враховує сарказм, галузевий жаргон та аспекти, даючи точність до 91% на російській мові. Така система використовується для моніторингу репутації та обробки зворотного зв'язку. Нижче — стек, метрики та реальний кейс. Економія на обробці звернень сягає 70%. Sentiment analysis (аналіз тональності) — задача обробки природної мови (NLP), що визначає емоційне забарвлення тексту.

Ми реалізуємо Sentiment analysis під ключ. Розкажемо, з якими труднощами стикаємося і як їх долаємо. Почнемо з вибору підходу.

Готові рішення vs кастомне навчання: що обрати?

Для більшості проєктів стартуйте з готової моделі. Для російської мови чудово підходить blanchefort/rubert-base-cased-sentiment (Hugging Face) — 3 класи, точність ~86% на загальних текстах. Для англійської — cardiffnlp/twitter-roberta-base-sentiment-latest. Але на галузевих даних точність падає. Порівняйте:

Модель Мова Класи Точність Швидкість (CPU)
blanchefort/rubert-base-cased-sentiment ru 3 ~86% 50-150ms
cardiffnlp/twitter-roberta-base-sentiment-latest en 3 ~92% 50-150ms
distilbert-base-uncased-finetuned-sst-2-english en 2 ~91% 15-30ms

Generic модель поступається fine-tuned у точності в 1.17 раза. Наприклад, на медичних відгуках generic давав 78%, а fine-tuning на 1500 прикладах — 91%. Fine-tuning на 500 прикладах дає приріст у 1.15 раза порівняно з zero-shot.

Чому кастомне навчання ефективніше за готові моделі?

Галузева специфіка — головний тригер. «Препарат не викликав побічних ефектів» — позитив у медицині, але нейтральна констатація. «Активне зниження» — негатив у фінансах. Доменний fine-tuning піднімає accuracy на 5–10% проти загальних моделей. Економія часу: обробка 1000 відгуків вручну — 40 годин, нашою системою — 2 хвилини (у 1200 разів швидше). Зниження витрат на обробку звернень сягає 70%.

Як працює аспектний аналіз тональності (ABSA)?

Відгук «Їжа смачна, але обслуговування жахливе, і ціни завищені» містить три аспекти з різною тональністю. ABSA витягує пари (аспект, тональність). Реалізуємо через sequence labeling з тегами B-ASP, I-ASP + класифікацію сентименту для кожного span. Застосовуємо в рітейлі та HoReCa. Для деплою використовуємо FastAPI, Docker, ONNX Runtime (latency p99 < 100ms), моніторинг Prometheus + Grafana.

Порівняння методів донавчання

Метод Точність на російській Необхідні дані Швидкість інференсу
Fine-tuning (BERT) ~91% 500-2000 прикладів 50-150ms
Few-shot (GPT-4) ~85-90% 10-50 прикладів 300-1000ms
Zero-shot (LLaMA) ~70-80% 0 прикладів 200-500ms

Як ми реалізуємо sentiment analysis: процес і стек

  1. Аналітика: вивчаємо корпус, обираємо архітектуру (BERT, RoBERTa), визначаємо baseline.
  2. Розмітка: анотуємо дані (мінімум 500 прикладів на клас) з контролем якості.
  3. Навчання: fine-tuning на Hugging Face Transformers, PyTorch, з логуванням у Weights & Biases.
  4. Тестування: метрики accuracy, precision, recall, F1 — на відкладеній вибірці та стрес-тестах (сарказм, змішані тони).
  5. Деплой: упаковка в Docker, інференс через ONNX Runtime або vLLM, API на FastAPI. Забезпечуємо latency p99 < 100ms.

Що входить у роботу

  • Розмічений датасет (з документуванням правил анотації)
  • Навчена модель (fine-tuned checkpoint)
  • Docker-образ з REST API
  • Технічна документація (model card, інструкція із запуску)
  • Навчання вашої команди роботі з моделлю
  • Пост-релізна підтримка (1 місяць)

Строки та вартість

Строки — від 2 до 6 тижнів залежно від обсягу даних і складності (ABSA, мультимовність). Вартість розраховується індивідуально після аудиту вашого корпусу та вимог. Гарантуємо прозоре ціноутворення без прихованих платежів.

Метрики та гарантії

Ми маємо 5+ років досвіду в NLP, виконали понад 50 проєктів з аналізу текстів. Серед клієнтів — рітейл, фінанси, телеком. Гарантуємо якість: ви отримуєте модель з метриками, узгодженими на старті. Якщо точність нижча — доопрацьовуємо безкоштовно.

Отримайте консультацію з вибору моделі: зв'яжіться з нами для аудиту вашого корпусу — ми оцінимо проєкт і запропонуємо оптимальне рішення. Замовте розробку кастомної системи аналізу тональності для вашого бізнесу. Не дозволяйте сарказму спотворювати реальність.

Про розмітку даних При розмітці ми використовуємо краудсорсинг із подвійною перевіркою. Для складних доменів залучаємо експертів галузі. Приклад: для медичних текстів розмітку виконують лікарі.