AI-система оцінки якості перекладу: QE без еталонів
Проблема: BLEU не бачить помилок стилю та термінології
Перекладач витратив дві години на пост-редагування перекладу, який система оцінила як 0.95 BLEU. Клієнт повернув проєкт через невідповідність style guide та неправильне використання термінів. BLEU порівнює з еталоном, але еталон часто не враховує контекст, тон та галузеву лексику. Ми вирішуємо це завдання за допомогою Quality Estimation (QE) — AI-системи, яка оцінює переклад без еталону, як людина-ревізор. Економія бюджету на рев'ю може сягати 60%.
Як працює оцінка якості без еталонного перекладу (QE)
Quality Estimation аналізує вихідний текст та переклад, обчислюючи score 0–1 на рівні сегмента, слова та документа. Сегментний рівень показує, які речення потребують перевірки. Словний рівень (word-level QE) розмічає кожне слово як OK або BAD — ревізор одразу бачить помилку. Документний рівень оцінює когерентність, послідовність термінології та стилістичну єдність.
Як QE економить 40–60% часу ревізора?
Припустимо, ви обробляєте 10 000 сегментів на день. Без QE ревізор переглядає кожен. З QE — лише сегменти з score < 0.7 (зазвичай 20–30%). При порозі 0.9 для автопублікації, 10–15% сегментів ідуть без перевірки. Ми впровадили такий pipeline у проєкті локалізації фінтех-додатку: ревізор став обробляти 3 000 сегментів замість 10 000, помилки стилю знизилися на 80%.
Чому CometKiwi кращий за BLEU для QE?
CometKiwi (Unbabel/wmt22-cometkiwi-da) — модель на основі трансформерів, навчена на тисячах оцінок від людей. Вона перевершує BLEU та традиційні метрики за кореляцією з людською оцінкою. Ось порівняння основних метрик:
| Метрика | Вимагає еталон? | Кореляція з людиною | Підтримка word-level | Час обробки (1K сегментів) |
|---|---|---|---|---|
| BLEU | Так | 0.3–0.4 | Ні | 1 сек |
| COMET | Так | 0.6–0.7 | Ні | 10 сек |
| CometKiwi (QE) | Ні | 0.6–0.7 | Так (через MQM) | 15 сек |
CometKiwi не вимагає еталону та дає word-level помилки через MQM-таксономію.
Які типи помилок класифікує QE?
Ми використовуємо MQM-таксономію, яка ділить помилки на чотири класи:
- Accuracy — неправильний переклад, пропуски, додавання.
- Fluency — граматика, орфографія, пунктуація.
- Terminology — порушення глосарію, непослідовне використання термінів.
- Style — невідповідність tone of voice, стилістичні розбіжності.
При впровадженні QE часто допускають типові помилки: використовують модель без донавчання під пару мов (падає precision), неправильно вибирають поріг score (пропускають помилки або перевантажують ревізора), ігнорують word-level QE (втрачають контекст окремих слів) та не інтегрують MQM (складно покращити процес).
Як ми впроваджуємо QE у ваш pipeline
- Аудит поточного процесу: вимірюємо volume, latency, поточні метрики.
- Вибір моделі: CometKiwi, OpenKiwi або донавчання під вашу пару мов.
- Інтеграція: REST API або gRPC — загортаємо в мікросервіс.
- Налаштування MQM-таксономії: підключаємо класифікатор типів помилок через LLM (GPT-4o або LLaMA 3).
- Тестування: вимірюємо precision/recall на вашому датасеті.
- Деплой: Kubernetes + GPU (T4 або A10).
from transformers import AutoModelForSequenceClassification, AutoTokenizer class QualityEstimator: def __init__(self, model_name: str = "Unbabel/wmt22-cometkiwi-da"): self.model = load_comet_model(model_name) def estimate_segment(self, source: str, hypothesis: str) -> QEScore: score = self.model.predict( [{"src": source, "mt": hypothesis}], batch_size=8 ).scores[0] return QEScore( score=score, # 0-1, де 1 = відмінна якість requires_review=score < 0.7, error_probability=1 - score ) def estimate_batch( self, segments: list[tuple[str, str]] ) -> list[QEScore]: data = [{"src": src, "mt": mt} for src, mt in segments] scores = self.model.predict(data, batch_size=32).scores return [QEScore(score=s, requires_review=s < 0.7) for s in scores] Порівняння моделей QE
| Модель | Пара мов | Розмір | Швидкість (1K сегментів) | Word-level |
|---|---|---|---|---|
| CometKiwi | Будь-яка | 1.2B | 15 сек | Так (через MQM) |
| OpenKiwi | Обмежена | 100M | 5 сек | Так |
| Fine-tuned | Ваша пара | За завданням | Залежить від розміру | Опціонально |
Що входить у роботу
- Аудит поточного pipeline перекладу з вимірюванням метрик.
- Вибір та налаштування QE-моделі (CometKiwi, OpenKiwi, донавчання).
- Інтеграція через REST API або gRPC з документацією.
- Навчання градації помилок під вашу MQM-таксономію.
- Розгортання на інфраструктурі (Kubernetes, GPU).
- Навчання команди та супровід 1 місяць.
Терміни та вартість
Терміни — від 2 до 6 тижнів залежно від складності (обсяг, кількість мов, необхідність донавчання). Вартість розраховується індивідуально. Отримайте консультацію — надішліть опис поточного pipeline, і ми оцінимо проєкт за 2 дні.
Чому варто працювати з нами
- Понад 5 років досвіду в NLP та машинному перекладі.
- Реалізували 15+ проєктів оцінки якості для fintech, e-commerce та локалізації ПЗ.
- Сертифіковані інженери з PyTorch та MLOps.
- Гарантуємо економію часу ревізора від 40% або повертаємо гроші.
Детальніше про Quality Estimation на Wikipedia.
Зв'яжіться з нами, щоб отримати консультацію з впровадження QE у ваш процес перекладу. Замовте оцінку вашого проєкту за 2 дні — надішліть опис поточного pipeline.







