При переводе юридических документов через DeepL мы получили 30% ошибок в терминологии. Клиенту потребовалась система, сохраняющая контекст контрактов и обеспечивающая конфиденциальность данных. Мы разработали решение на базе fine-tuned MarianMT. Постобработка по терминологическому словарю обеспечила точность до 97%. Нередко готовые сервисы не справляются с отраслевой лексикой: юридические, медицинские или технические тексты теряют до 30% точности ключевых терминов. Для компаний, обрабатывающих большие объёмы документов, это оборачивается рисками и дополнительными затратами на вычитку. Мы решаем эту проблему с помощью кастомизированных моделей машинного перевода, которые адаптируются под предметную область и требования конфиденциальности.
Машинный перевод прошёл путь от статистических моделей (Moses) через нейронные (seq2seq+attention) к современным трансформерам. Сегодня для большинства языковых пар доступны готовые модели высокого качества. Задача сводится к выбору правильной модели и интеграции в продукт. Наши инженеры имеют сертификаты по NLP и опыт в машинном переводе. Гарантируем точность перевода не ниже BLEU ≥35 для доменных моделей (подробнее о метрике BLEU).
Как выбрать модель для машинного перевода?
Готовые API (лучшее качество, простота):
- Google Cloud Translation API: 500K символов/месяц бесплатно, >100 языков, плата за объём
- DeepL API: превосходит Google для европейских языков, ежемесячная подписка
- OpenAI GPT-4o: для контекстно-зависимого перевода (маркетинг, литература)
Open-source модели (приватность, on-premise, нет затрат на API):
- MarianMT (Helsinki-NLP): компактные модели для 1000+ языковых пар, Hugging Face
- NLLB-200 (Meta): 200 языков включая редкие, качество близко к Google для мн. пар
- SeamlessM4T (Meta): мультимодальная — текст и речь, 100+ языков
- Opus-MT: большая коллекция обученных MarianMT моделей
Почему fine-tuning необходим для отраслевых текстов?
Готовые модели плохо справляются с отраслевой терминологией. Для юридических, медицинских или технических текстов fine-tuning на 10–100 тыс. параллельных предложений повышает BLEU на 3–8 пунктов. Это в 2–3 раза больше, чем прирост от простого терминологического словаря. Мы реализовали такой проект для клиента из промышленности: дообучили MarianMT на 50 тыс. пар предложений — BLEU вырос с 30 до 37, а затраты на постобработку сократились на 80%.
Стратегии улучшения перевода:
- Терминологические словари: пост-обработка перевода с заменой на утверждённые термины. Библиотека
sacremosesдля детокенизации, затем regex-замена. - Fine-tuning на доменных данных: 10K–100K параллельных предложений из вашей области. MarianMT обучается на одном GPU за несколько часов. Качество растёт на 3–8 BLEU для специализированных текстов.
- Промпт-инжиниринг для LLM: GPT-4o с инструкцией «переводи медицинские тексты, сохраняй латинские термины» без fine-tuning.
| Подход | Требуемые данные | Улучшение BLEU | Время внедрения |
|---|---|---|---|
| Терминологический словарь | 100–500 терминов | +1–2 BLEU | 1 день |
| Fine-tuning | 10K–100K предложений | +3–8 BLEU | 1–2 недели |
| Prompt engineering LLM | 0 | +0–3 BLEU | 1 час |
Как мы это делаем: стек и процесс
Процесс внедрения включает следующие этапы:
- Анализ требований и спецификация языковых пар, объёмов, privacy constraints.
- Выбор модели (API или open-source) и сбор параллельных данных.
- Fine-tuning на доменных данных (если требуется).
- Интеграция через REST API или gRPC.
- Тестирование качества (BLEU, COMET, A/B-тест на реальных пользователях).
- Деплой в production и мониторинг латентности и качества.
Пример интеграции с использованием MarianMT:
from transformers import MarianMTModel, MarianTokenizer model_name = "Helsinki-NLP/opus-mt-ru-en" tokenizer = MarianTokenizer.from_pretrained(model_name) model = MarianMTModel.from_pretrained(model_name) def translate(texts: list[str]) -> list[str]: inputs = tokenizer(texts, return_tensors="pt", padding=True, truncation=True) translated = model.generate(**inputs) return tokenizer.batch_decode(translated, skip_special_tokens=True) Для длинных документов (больше 512 токенов) используем чанкинг с перекрытием: разбиваем на предложения через nltk.sent_tokenize, переводим по одному, затем собираем с учётом форматирования. Для GPT-4o — чанкинг по абзацам с последним предложением предыдущего чанка для сохранения контекста.
Оценка качества: BLEU, COMET (модель Unbabel/wmt22-comet-da) и chrF. В production запускаем A/B-тест на реальных пользователях — сравниваем time-on-page и явные оценки.
Процесс работы
| Этап | Длительность | Результат |
|---|---|---|
| Аналитика и сбор требований | 1–3 дня | Спецификация языковых пар, объёмов, privacy constraints |
| Выбор модели и данных | 2–5 дней | Определение API или open-source, сбор параллельных данных |
| Fine-tuning (если нужен) | 1–2 недели | Модель с BLEU ≥35 для домена |
| Интеграция и тестирование | 1 неделя | API или сервис, A/B-тест |
| Деплой и мониторинг | 1–3 дня | Production, мониторинг p99 latency через Prometheus |
Что входит в работу
- Анализ текущего пайплайна перевода и требований
- Подбор модели: API или open-source с кастомизацией
- Fine-tuning и обучение на ваших данных
- Интеграция через REST API или gRPC
- Автоматическая оценка качества (BLEU, COMET)
- Документация и обучение команды
- Поддержка после внедрения: 1 месяц
Типичные ошибки при внедрении
Чек-лист для самопроверки
- Не используют тестовую выборку — доверяют BLEU на тренировочных данных
- Игнорируют постобработку (регистр, пунктуация, термины)
- Завышают ожидания от GPT-4o: без fine-tuning он не даёт стабильного качества на редких языках
- Не учитывают latency: для real-time перевода нужны компактные модели (MarianMT) или Triton Inference Server
- Пропускают этап безопасного развёртывания (privacy при использовании облачных API)
Сроки и стоимость
Проект реализуем от 2 недель до 2 месяцев в зависимости от сложности и необходимости fine-tuning. Стоимость рассчитывается индивидуально — она зависит от объёмов, выбранного подхода и требований к конфиденциальности. Свяжитесь с нами для бесплатной консультации — мы подберём оптимальное решение под ваши задачи и объёмы. Закажите пилотный перевод на ваших данных и оцените результат.







