При перекладі юридичних документів через DeepL ми отримали 30% помилок у термінології. Клієнту потрібна була система, що зберігає контекст контрактів і забезпечує конфіденційність даних. Ми розробили рішення на базі fine-tuned MarianMT. Постобробка за термінологічним словником забезпечила точність до 97%. Нерідко готові сервіси не справляються з галузевою лексикою: юридичні, медичні або технічні тексти втрачають до 30% точності ключових термінів. Для компаній, що обробляють великі обсяги документів, це обертається ризиками та додатковими витратами на вичитку. Ми вирішуємо цю проблему за допомогою кастомізованих моделей машинного перекладу, які адаптуються під предметну область і вимоги конфіденційності.
Машинний переклад пройшов шлях від статистичних моделей (Moses) через нейронні (seq2seq+attention) до сучасних трансформерів. Сьогодні для більшості мовних пар доступні готові моделі високої якості. Завдання зводиться до вибору правильної моделі та інтеграції в продукт. Наші інженери мають 5+ років досвіду в NLP і виконали 50+ проектів з машинного перекладу для різних галузей. Гарантуємо точність перекладу не нижче BLEU ≥35 для доменних моделей (детальніше про метрику BLEU).
Як вибрати модель для машинного перекладу?
Готові API (найкраща якість, простота):
- Google Cloud Translation API: 500K символів/місяць безплатно, >100 мов, плата за обсяг
- DeepL API: перевершує Google для європейських мов, щомісячна підписка
- OpenAI GPT-4o: для контекстно-залежного перекладу (маркетинг, література)
Open-source моделі (приватність, on-premise, нема витрат на API):
- MarianMT (Helsinki-NLP): компактні моделі для 1000+ мовних пар, Hugging Face
- NLLB-200 (Meta): 200 мов включаючи рідкісні, якість близька до Google для багатьох пар
- SeamlessM4T (Meta): мультимодальна — текст і мова, 100+ мов
- Opus-MT: велика колекція навчених моделей MarianMT
Чому fine-tuning необхідний для галузевих текстів?
Готові моделі погано справляються з галузевою термінологією. Для юридичних, медичних або технічних текстів fine-tuning на 10–100 тис. паралельних речень підвищує BLEU на 3–8 пунктів. Це в 2–3 рази більше, ніж приріст від простого термінологічного словника. Ми реалізували такий проект для клієнта з промисловості: донавчили MarianMT на 50 тис. пар речень — BLEU зріс з 30 до 37, а витрати на постобробку скоротилися на 80%.
Стратегії покращення перекладу:
- Термінологічні словники: пост-обробка перекладу із заміною на затверджені терміни. Бібліотека
sacremosesдля детокенізації, потім regex-заміна. - Fine-tuning на доменних даних: 10K–100K паралельних речень з вашої області. MarianMT навчається на одному GPU за кілька годин. Якість зростає на 3–8 BLEU для спеціалізованих текстів.
- Промпт-інжиніринг для LLM: GPT-4o з інструкцією «перекладай медичні тексти, зберігай латинські терміни» без fine-tuning.
| Підхід | Потрібні дані | Покращення BLEU | Час впровадження |
|---|---|---|---|
| Термінологічний словник | 100–500 термінів | +1–2 BLEU | 1 день |
| Fine-tuning | 10K–100K речень | +3–8 BLEU | 1–2 тижні |
| Prompt engineering LLM | 0 | +0–3 BLEU | 1 година |
Як ми це робимо: стек і процес
Процес впровадження включає наступні етапи:
- Аналіз вимог і специфікація мовних пар, обсягів, privacy constraints.
- Вибір моделі (API або open-source) і збір паралельних даних.
- Fine-tuning на доменних даних (якщо потрібно).
- Інтеграція через REST API або gRPC.
- Тестування якості (BLEU, COMET, A/B-тест на реальних користувачах).
- Деплой у production і моніторинг латентності та якості.
Приклад інтеграції з використанням MarianMT:
from transformers import MarianMTModel, MarianTokenizer model_name = "Helsinki-NLP/opus-mt-ru-en" tokenizer = MarianTokenizer.from_pretrained(model_name) model = MarianMTModel.from_pretrained(model_name) def translate(texts: list[str]) -> list[str]: inputs = tokenizer(texts, return_tensors="pt", padding=True, truncation=True) translated = model.generate(**inputs) return tokenizer.batch_decode(translated, skip_special_tokens=True) Для довгих документів (більше 512 токенів) використовуємо чанкінг з перекриттям: розбиваємо на речення через nltk.sent_tokenize, перекладаємо по одному, потім збираємо з урахуванням форматування. Для GPT-4o — чанкінг по абзацах з останнім реченням попереднього чанка для збереження контексту.
Оцінка якості: BLEU, COMET (модель Unbabel/wmt22-comet-da) та chrF. У production запускаємо A/B-тест на реальних користувачах — порівнюємо time-on-page та явні оцінки.
Процес роботи
| Етап | Тривалість | Результат |
|---|---|---|
| Аналітика та збір вимог | 1–3 дні | Специфікація мовних пар, обсягів, privacy constraints |
| Вибір моделі та даних | 2–5 днів | Визначення API або open-source, збір паралельних даних |
| Fine-tuning (якщо потрібен) | 1–2 тижні | Модель з BLEU ≥35 для домену |
| Інтеграція та тестування | 1 тиждень | API або сервіс, A/B-тест |
| Деплой і моніторинг | 1–3 дні | Production, моніторинг p99 latency через Prometheus |
Що входить у роботу
- Аналіз поточного пайплайну перекладу та вимог
- Підбір моделі: API або open-source з кастомізацією
- Fine-tuning та навчання на ваших даних
- Інтеграція через REST API або gRPC
- Автоматична оцінка якості (BLEU, COMET)
- Документація та навчання команди
- Підтримка після впровадження: 1 місяць
Типові помилки при впровадженні
Чек-лист для самоперевірки
- Не використовують тестову вибірку — довіряють BLEU на тренувальних даних
- Ігнорують постобробку (регістр, пунктуація, терміни)
- Завищують очікування від GPT-4o: без fine-tuning він не дає стабільної якості на рідкісних мовах
- Не враховують latency: для real-time перекладу потрібні компактні моделі (MarianMT) або Triton Inference Server
- Пропускають етап безпечного розгортання (privacy при використанні хмарних API)
Строки та вартість
Проект реалізуємо від 2 тижнів до 2 місяців залежно від складності та необхідності fine-tuning. Вартість розраховується індивідуально — вона залежить від обсягів, обраного підходу та вимог до конфіденційності. Наприклад, для проекту з перекладом 500 тис. слів на місяць економія від впровадження може скласти до $10 000/міс. Зв'яжіться з нами для безплатної консультації — ми підберемо оптимальне рішення під ваші завдання та обсяги. Замовте пілотний переклад на ваших даних і оцініть результат. Працюємо під ключ за 2 тижні для типових інтеграцій — пишіть, оцінимо проект безкоштовно. Наші фахівці мають 5+ років досвіду в NLP та виконали 50+ проектів машинного перекладу для різних галузей, що підтверджує надійність.
Нейромережевий переклад — це сучасний підхід, який забезпечує високу якість навіть для складних мовних пар.







