Реалізація сумаризації тексту: екстрактивна та абстрактивна
При сумаризації новинного потоку обсягом 10 000 статей на день розробники стикаються з дилемою: екстракція не дає зв'язного тексту, а абстракція загрожує галюцинаціями. Який підхід обрати та як автоматизувати цей процес під ключ? Ми це вирішуємо, комбінуючи методи та налаштовуючи їх під ваші дані.
Проблеми, які ми вирішуємо
Перша проблема — галюцинації в абстрактивних моделях. У юридичних документах вартість помилки може сягати мільйонів, тому ми віддаємо перевагу гібриду: екстракція для безпечного виділення фактів + донавчена T5 для фінального тексту. Друга — обмеження контекстного вікна. Документи >128k токенів доводиться чанкувати з перекриттям 10% і використовувати ієрархічну сумаризацію: спочатку за розділами, потім зведення. Третя — продуктивність: під навантаженням 2000 req/s latency p99 не повинна перевищувати 500 мс. Ми вирішуємо це через vLLM, ONNX Runtime та квантування INT8.
Як ми це робимо: стек та кейс
На одному з проєктів (агрегатор корпоративних новин) ми налаштували гібридну систему. Перший прохід — екстрактивний відбір речень через TextRank з порогом схожості 0.7. Другий — генерація підсумку з відібраних речень за допомогою IlyaGusev/rut5-base-absum, донавченої LoRA на новинах компанії. Інференс прискорили через ONNX Runtime з dynamic quantization — FLOPS зросли до 150 TFLOPS на одній A100. Результат: ROUGE-1 0.52, BERTScore 0.68, latency p99 — 320 мс. Це дозволило скоротити час читання на 60%.
Чому абстрактивна сумаризація генерує помилки?
Моделі на кшталт GPT-4o схильні до hallucination, коли контекст розпливчастий або містить суперечності. Щоб це мінімізувати, ми використовуємо few-shot промпти з прикладами з вашого домену та додаємо обмеження: "Не використовуй факти, відсутні в тексті". Для критичних сценаріїв ефективний chain-of-thought — модель спочатку виділяє факти, а потім формулює резюме. Важливо також враховувати, що якість сумаризації безпосередньо залежить від репрезентативності навчальних даних: донавчання на 10 000 документів вашого домену може підвищити BERTScore на 0.05. За нашими тестами, гібридна схема з донавченою T5 перевершує чисту екстракцію за ROUGE-1 в 1.3 раза.
Як обрати між екстрактивною та абстрактивною сумаризацією?
| Сценарій | Рекомендація |
|---|---|
| Новинні тексти, швидкість важлива | TextRank або rut5-base-absum |
| Юридичні/медичні документи | Екстрактивна (без галюцинацій) |
| Бізнес-звіти, якість важлива | GPT-4o з Map-Reduce |
| Високе навантаження (>100 req/s) | Дистильований T5 + ONNX |
Порівняння підходів за критеріями
| Критерій | Екстрактивна | Абстрактивна |
|---|---|---|
| Галюцинації | Немає | Ризик є |
| Зв'язність тексту | Низька | Висока |
| Вимоги до даних | Не потребує | Потребує fine-tuning |
| Швидкість інференсу | Висока | Середня (з ONNX – висока) |
| Latency p99 | <50 мс | <500 мс (оптимізована) |
Процес роботи
- Аналіз вимог: тип контенту, обсяг токенів, метрики успіху (ROUGE, BERTScore, latency).
- Вибір архітектури: екстрактивна, абстрактивна або гібрид.
- Тренування/донавчання: LoRA fine-tuning для абстрактивної моделі.
- Інтеграція: REST/gRPC API на базі Docker-образу.
- Тестування: ROUGE/BERTScore + A/B тест на живих даних.
- Деплой: vLLM, ONNX, моніторинг через Weights & Biases.
Терміни орієнтовно
Базова екстрактивна сумаризація налаштовується за 3 робочі дні. Абстрактивна з донавчанням та production-ready інтеграцією — від 2 до 4 тижнів. Вартість розраховується індивідуально: зв'яжіться з нами — оцінимо ваш проєкт.
Що входить у роботу
- Архітектурна документація (model card, pipeline diagram).
- Код моделі в Docker-образі з ONNX runtime.
- Інтеграційний тест (зразок виклику API).
- Доступ до моніторингу MLflow.
- Навчання команди (2 години вебінар з розбором кейсів).
- Гарантія 3 місяці на супровід.
Як оптимізувати latency для production?
Оптимізована на ONNX модель працює в 2-3 рази швидше за базовий PyTorch. Для високих навантажень ми використовуємо vLLM з безперервним батчингом — це знижує latency p99 до 300 мс при 1000 req/s. Замовте пілотний проєкт — ми проведемо A/B тест на ваших даних.
Приклад запиту до API (Python)
import requests data = {"text": "...", "max_tokens": 150} response = requests.post("http://your-api-endpoint", json=data) # замініть на реальний URL print(response.json()["summary"]) Наш досвід — 5+ проєктів з сумаризації текстів, від новинних стрічок до юридичних документів. Гарантуємо результат, що відповідає вашим метрикам. Отримайте консультацію — пишіть.







