AI-система оцінки якості перекладу: QE без еталонів

AI-система оцінки якості перекладу: QE без еталонів ### Проблема: BLEU не бачить помилок стилю та термінології Перекладач витратив дві години на пост-редагування перекладу, який система оцінила як 0.95 BLEU. Клієнт повернув проєкт через невідповідність style guide та неправильне використання т

Напрямки AI-розробки

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1440
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    998
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1264
  • image_logo-advance_0.webp
    Розробка логотипу компанії B2B Advance
    713
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    1002

AI-система оцінки якості перекладу: QE без еталонів

Проблема: BLEU не бачить помилок стилю та термінології

Перекладач витратив дві години на пост-редагування перекладу, який система оцінила як 0.95 BLEU. Клієнт повернув проєкт через невідповідність style guide та неправильне використання термінів. BLEU порівнює з еталоном, але еталон часто не враховує контекст, тон та галузеву лексику. Ми вирішуємо це завдання за допомогою Quality Estimation (QE) — AI-системи, яка оцінює переклад без еталону, як людина-ревізор. Економія бюджету на рев'ю може сягати 60%.

Як працює оцінка якості без еталонного перекладу (QE)

Quality Estimation аналізує вихідний текст та переклад, обчислюючи score 0–1 на рівні сегмента, слова та документа. Сегментний рівень показує, які речення потребують перевірки. Словний рівень (word-level QE) розмічає кожне слово як OK або BAD — ревізор одразу бачить помилку. Документний рівень оцінює когерентність, послідовність термінології та стилістичну єдність.

Як QE економить 40–60% часу ревізора?

Припустимо, ви обробляєте 10 000 сегментів на день. Без QE ревізор переглядає кожен. З QE — лише сегменти з score < 0.7 (зазвичай 20–30%). При порозі 0.9 для автопублікації, 10–15% сегментів ідуть без перевірки. Ми впровадили такий pipeline у проєкті локалізації фінтех-додатку: ревізор став обробляти 3 000 сегментів замість 10 000, помилки стилю знизилися на 80%.

Чому CometKiwi кращий за BLEU для QE?

CometKiwi (Unbabel/wmt22-cometkiwi-da) — модель на основі трансформерів, навчена на тисячах оцінок від людей. Вона перевершує BLEU та традиційні метрики за кореляцією з людською оцінкою. Ось порівняння основних метрик:

Метрика Вимагає еталон? Кореляція з людиною Підтримка word-level Час обробки (1K сегментів)
BLEU Так 0.3–0.4 Ні 1 сек
COMET Так 0.6–0.7 Ні 10 сек
CometKiwi (QE) Ні 0.6–0.7 Так (через MQM) 15 сек

CometKiwi не вимагає еталону та дає word-level помилки через MQM-таксономію.

Які типи помилок класифікує QE?

Ми використовуємо MQM-таксономію, яка ділить помилки на чотири класи:

  • Accuracy — неправильний переклад, пропуски, додавання.
  • Fluency — граматика, орфографія, пунктуація.
  • Terminology — порушення глосарію, непослідовне використання термінів.
  • Style — невідповідність tone of voice, стилістичні розбіжності.

При впровадженні QE часто допускають типові помилки: використовують модель без донавчання під пару мов (падає precision), неправильно вибирають поріг score (пропускають помилки або перевантажують ревізора), ігнорують word-level QE (втрачають контекст окремих слів) та не інтегрують MQM (складно покращити процес).

Як ми впроваджуємо QE у ваш pipeline

  1. Аудит поточного процесу: вимірюємо volume, latency, поточні метрики.
  2. Вибір моделі: CometKiwi, OpenKiwi або донавчання під вашу пару мов.
  3. Інтеграція: REST API або gRPC — загортаємо в мікросервіс.
  4. Налаштування MQM-таксономії: підключаємо класифікатор типів помилок через LLM (GPT-4o або LLaMA 3).
  5. Тестування: вимірюємо precision/recall на вашому датасеті.
  6. Деплой: Kubernetes + GPU (T4 або A10).
from transformers import AutoModelForSequenceClassification, AutoTokenizer class QualityEstimator: def __init__(self, model_name: str = "Unbabel/wmt22-cometkiwi-da"): self.model = load_comet_model(model_name) def estimate_segment(self, source: str, hypothesis: str) -> QEScore: score = self.model.predict( [{"src": source, "mt": hypothesis}], batch_size=8 ).scores[0] return QEScore( score=score, # 0-1, де 1 = відмінна якість requires_review=score < 0.7, error_probability=1 - score ) def estimate_batch( self, segments: list[tuple[str, str]] ) -> list[QEScore]: data = [{"src": src, "mt": mt} for src, mt in segments] scores = self.model.predict(data, batch_size=32).scores return [QEScore(score=s, requires_review=s < 0.7) for s in scores] 

Порівняння моделей QE

Модель Пара мов Розмір Швидкість (1K сегментів) Word-level
CometKiwi Будь-яка 1.2B 15 сек Так (через MQM)
OpenKiwi Обмежена 100M 5 сек Так
Fine-tuned Ваша пара За завданням Залежить від розміру Опціонально

Що входить у роботу

  • Аудит поточного pipeline перекладу з вимірюванням метрик.
  • Вибір та налаштування QE-моделі (CometKiwi, OpenKiwi, донавчання).
  • Інтеграція через REST API або gRPC з документацією.
  • Навчання градації помилок під вашу MQM-таксономію.
  • Розгортання на інфраструктурі (Kubernetes, GPU).
  • Навчання команди та супровід 1 місяць.

Терміни та вартість

Терміни — від 2 до 6 тижнів залежно від складності (обсяг, кількість мов, необхідність донавчання). Вартість розраховується індивідуально. Отримайте консультацію — надішліть опис поточного pipeline, і ми оцінимо проєкт за 2 дні.

Чому варто працювати з нами

  • Понад 5 років досвіду в NLP та машинному перекладі.
  • Реалізували 15+ проєктів оцінки якості для fintech, e-commerce та локалізації ПЗ.
  • Сертифіковані інженери з PyTorch та MLOps.
  • Гарантуємо економію часу ревізора від 40% або повертаємо гроші.

Детальніше про Quality Estimation на Wikipedia.

Зв'яжіться з нами, щоб отримати консультацію з впровадження QE у ваш процес перекладу. Замовте оцінку вашого проєкту за 2 дні — надішліть опис поточного pipeline.