Реалізація сумаризації тексту: екстрактивна та абстрактивна

Реалізація сумаризації тексту: екстрактивна та абстрактивна

Напрямки AI-розробки

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1440
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    997
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1264
  • image_logo-advance_0.webp
    Розробка логотипу компанії B2B Advance
    712
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    1002

Реалізація сумаризації тексту: екстрактивна та абстрактивна

При сумаризації новинного потоку обсягом 10 000 статей на день розробники стикаються з дилемою: екстракція не дає зв'язного тексту, а абстракція загрожує галюцинаціями. Який підхід обрати та як автоматизувати цей процес під ключ? Ми це вирішуємо, комбінуючи методи та налаштовуючи їх під ваші дані.

Проблеми, які ми вирішуємо

Перша проблема — галюцинації в абстрактивних моделях. У юридичних документах вартість помилки може сягати мільйонів, тому ми віддаємо перевагу гібриду: екстракція для безпечного виділення фактів + донавчена T5 для фінального тексту. Друга — обмеження контекстного вікна. Документи >128k токенів доводиться чанкувати з перекриттям 10% і використовувати ієрархічну сумаризацію: спочатку за розділами, потім зведення. Третя — продуктивність: під навантаженням 2000 req/s latency p99 не повинна перевищувати 500 мс. Ми вирішуємо це через vLLM, ONNX Runtime та квантування INT8.

Як ми це робимо: стек та кейс

На одному з проєктів (агрегатор корпоративних новин) ми налаштували гібридну систему. Перший прохід — екстрактивний відбір речень через TextRank з порогом схожості 0.7. Другий — генерація підсумку з відібраних речень за допомогою IlyaGusev/rut5-base-absum, донавченої LoRA на новинах компанії. Інференс прискорили через ONNX Runtime з dynamic quantization — FLOPS зросли до 150 TFLOPS на одній A100. Результат: ROUGE-1 0.52, BERTScore 0.68, latency p99 — 320 мс. Це дозволило скоротити час читання на 60%.

Чому абстрактивна сумаризація генерує помилки?

Моделі на кшталт GPT-4o схильні до hallucination, коли контекст розпливчастий або містить суперечності. Щоб це мінімізувати, ми використовуємо few-shot промпти з прикладами з вашого домену та додаємо обмеження: "Не використовуй факти, відсутні в тексті". Для критичних сценаріїв ефективний chain-of-thought — модель спочатку виділяє факти, а потім формулює резюме. Важливо також враховувати, що якість сумаризації безпосередньо залежить від репрезентативності навчальних даних: донавчання на 10 000 документів вашого домену може підвищити BERTScore на 0.05. За нашими тестами, гібридна схема з донавченою T5 перевершує чисту екстракцію за ROUGE-1 в 1.3 раза.

Як обрати між екстрактивною та абстрактивною сумаризацією?

Сценарій Рекомендація
Новинні тексти, швидкість важлива TextRank або rut5-base-absum
Юридичні/медичні документи Екстрактивна (без галюцинацій)
Бізнес-звіти, якість важлива GPT-4o з Map-Reduce
Високе навантаження (>100 req/s) Дистильований T5 + ONNX

Порівняння підходів за критеріями

Критерій Екстрактивна Абстрактивна
Галюцинації Немає Ризик є
Зв'язність тексту Низька Висока
Вимоги до даних Не потребує Потребує fine-tuning
Швидкість інференсу Висока Середня (з ONNX – висока)
Latency p99 <50 мс <500 мс (оптимізована)

Процес роботи

  1. Аналіз вимог: тип контенту, обсяг токенів, метрики успіху (ROUGE, BERTScore, latency).
  2. Вибір архітектури: екстрактивна, абстрактивна або гібрид.
  3. Тренування/донавчання: LoRA fine-tuning для абстрактивної моделі.
  4. Інтеграція: REST/gRPC API на базі Docker-образу.
  5. Тестування: ROUGE/BERTScore + A/B тест на живих даних.
  6. Деплой: vLLM, ONNX, моніторинг через Weights & Biases.

Терміни орієнтовно

Базова екстрактивна сумаризація налаштовується за 3 робочі дні. Абстрактивна з донавчанням та production-ready інтеграцією — від 2 до 4 тижнів. Вартість розраховується індивідуально: зв'яжіться з нами — оцінимо ваш проєкт.

Що входить у роботу

  • Архітектурна документація (model card, pipeline diagram).
  • Код моделі в Docker-образі з ONNX runtime.
  • Інтеграційний тест (зразок виклику API).
  • Доступ до моніторингу MLflow.
  • Навчання команди (2 години вебінар з розбором кейсів).
  • Гарантія 3 місяці на супровід.

Як оптимізувати latency для production?

Оптимізована на ONNX модель працює в 2-3 рази швидше за базовий PyTorch. Для високих навантажень ми використовуємо vLLM з безперервним батчингом — це знижує latency p99 до 300 мс при 1000 req/s. Замовте пілотний проєкт — ми проведемо A/B тест на ваших даних.

Приклад запиту до API (Python)
import requests data = {"text": "...", "max_tokens": 150} response = requests.post("http://your-api-endpoint", json=data) # замініть на реальний URL print(response.json()["summary"]) 

Наш досвід — 5+ проєктів з сумаризації текстів, від новинних стрічок до юридичних документів. Гарантуємо результат, що відповідає вашим метрикам. Отримайте консультацію — пишіть.