Разработка и внедрение системы машинного перевода текста

При переводе юридических документов через DeepL мы получили 30% ошибок в терминологии. Клиенту потребовалась система, сохраняющая контекст контрактов и обеспечивающая конфиденциальность данных. Мы разработали решение на базе fine-tuned MarianMT. Постобработка по терминологическому словарю обеспечила

Направления AI-разработки

Часто задаваемые вопросы

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1439
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    997
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1264
  • image_logo-advance_0.webp
    Разработка логотипа компании B2B Advance
    712
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    1002

При переводе юридических документов через DeepL мы получили 30% ошибок в терминологии. Клиенту потребовалась система, сохраняющая контекст контрактов и обеспечивающая конфиденциальность данных. Мы разработали решение на базе fine-tuned MarianMT. Постобработка по терминологическому словарю обеспечила точность до 97%. Нередко готовые сервисы не справляются с отраслевой лексикой: юридические, медицинские или технические тексты теряют до 30% точности ключевых терминов. Для компаний, обрабатывающих большие объёмы документов, это оборачивается рисками и дополнительными затратами на вычитку. Мы решаем эту проблему с помощью кастомизированных моделей машинного перевода, которые адаптируются под предметную область и требования конфиденциальности.

Машинный перевод прошёл путь от статистических моделей (Moses) через нейронные (seq2seq+attention) к современным трансформерам. Сегодня для большинства языковых пар доступны готовые модели высокого качества. Задача сводится к выбору правильной модели и интеграции в продукт. Наши инженеры имеют сертификаты по NLP и опыт в машинном переводе. Гарантируем точность перевода не ниже BLEU ≥35 для доменных моделей (подробнее о метрике BLEU).

Как выбрать модель для машинного перевода?

Готовые API (лучшее качество, простота):

  • Google Cloud Translation API: 500K символов/месяц бесплатно, >100 языков, плата за объём
  • DeepL API: превосходит Google для европейских языков, ежемесячная подписка
  • OpenAI GPT-4o: для контекстно-зависимого перевода (маркетинг, литература)

Open-source модели (приватность, on-premise, нет затрат на API):

  • MarianMT (Helsinki-NLP): компактные модели для 1000+ языковых пар, Hugging Face
  • NLLB-200 (Meta): 200 языков включая редкие, качество близко к Google для мн. пар
  • SeamlessM4T (Meta): мультимодальная — текст и речь, 100+ языков
  • Opus-MT: большая коллекция обученных MarianMT моделей

Почему fine-tuning необходим для отраслевых текстов?

Готовые модели плохо справляются с отраслевой терминологией. Для юридических, медицинских или технических текстов fine-tuning на 10–100 тыс. параллельных предложений повышает BLEU на 3–8 пунктов. Это в 2–3 раза больше, чем прирост от простого терминологического словаря. Мы реализовали такой проект для клиента из промышленности: дообучили MarianMT на 50 тыс. пар предложений — BLEU вырос с 30 до 37, а затраты на постобработку сократились на 80%.

Стратегии улучшения перевода:

  • Терминологические словари: пост-обработка перевода с заменой на утверждённые термины. Библиотека sacremoses для детокенизации, затем regex-замена.
  • Fine-tuning на доменных данных: 10K–100K параллельных предложений из вашей области. MarianMT обучается на одном GPU за несколько часов. Качество растёт на 3–8 BLEU для специализированных текстов.
  • Промпт-инжиниринг для LLM: GPT-4o с инструкцией «переводи медицинские тексты, сохраняй латинские термины» без fine-tuning.
Подход Требуемые данные Улучшение BLEU Время внедрения
Терминологический словарь 100–500 терминов +1–2 BLEU 1 день
Fine-tuning 10K–100K предложений +3–8 BLEU 1–2 недели
Prompt engineering LLM 0 +0–3 BLEU 1 час

Как мы это делаем: стек и процесс

Процесс внедрения включает следующие этапы:

  1. Анализ требований и спецификация языковых пар, объёмов, privacy constraints.
  2. Выбор модели (API или open-source) и сбор параллельных данных.
  3. Fine-tuning на доменных данных (если требуется).
  4. Интеграция через REST API или gRPC.
  5. Тестирование качества (BLEU, COMET, A/B-тест на реальных пользователях).
  6. Деплой в production и мониторинг латентности и качества.

Пример интеграции с использованием MarianMT:

from transformers import MarianMTModel, MarianTokenizer model_name = "Helsinki-NLP/opus-mt-ru-en" tokenizer = MarianTokenizer.from_pretrained(model_name) model = MarianMTModel.from_pretrained(model_name) def translate(texts: list[str]) -> list[str]: inputs = tokenizer(texts, return_tensors="pt", padding=True, truncation=True) translated = model.generate(**inputs) return tokenizer.batch_decode(translated, skip_special_tokens=True) 

Для длинных документов (больше 512 токенов) используем чанкинг с перекрытием: разбиваем на предложения через nltk.sent_tokenize, переводим по одному, затем собираем с учётом форматирования. Для GPT-4o — чанкинг по абзацам с последним предложением предыдущего чанка для сохранения контекста.

Оценка качества: BLEU, COMET (модель Unbabel/wmt22-comet-da) и chrF. В production запускаем A/B-тест на реальных пользователях — сравниваем time-on-page и явные оценки.

Процесс работы

Этап Длительность Результат
Аналитика и сбор требований 1–3 дня Спецификация языковых пар, объёмов, privacy constraints
Выбор модели и данных 2–5 дней Определение API или open-source, сбор параллельных данных
Fine-tuning (если нужен) 1–2 недели Модель с BLEU ≥35 для домена
Интеграция и тестирование 1 неделя API или сервис, A/B-тест
Деплой и мониторинг 1–3 дня Production, мониторинг p99 latency через Prometheus

Что входит в работу

  • Анализ текущего пайплайна перевода и требований
  • Подбор модели: API или open-source с кастомизацией
  • Fine-tuning и обучение на ваших данных
  • Интеграция через REST API или gRPC
  • Автоматическая оценка качества (BLEU, COMET)
  • Документация и обучение команды
  • Поддержка после внедрения: 1 месяц

Типичные ошибки при внедрении

Чек-лист для самопроверки
  • Не используют тестовую выборку — доверяют BLEU на тренировочных данных
  • Игнорируют постобработку (регистр, пунктуация, термины)
  • Завышают ожидания от GPT-4o: без fine-tuning он не даёт стабильного качества на редких языках
  • Не учитывают latency: для real-time перевода нужны компактные модели (MarianMT) или Triton Inference Server
  • Пропускают этап безопасного развёртывания (privacy при использовании облачных API)

Сроки и стоимость

Проект реализуем от 2 недель до 2 месяцев в зависимости от сложности и необходимости fine-tuning. Стоимость рассчитывается индивидуально — она зависит от объёмов, выбранного подхода и требований к конфиденциальности. Свяжитесь с нами для бесплатной консультации — мы подберём оптимальное решение под ваши задачи и объёмы. Закажите пилотный перевод на ваших данных и оцените результат.