Разработка системы проверки грамматики и орфографии с LLM

Отметим: когда редактор пропускает контекстную ошибку вроде «Я пошёл в магазин за хлебои» или неверное согласование «красивый пальто», пользователь теряет доверие. Наша команда с 10+ годами опыта в NLP и MLOps построила гибридную систему, которая ловит 99% таких случаев: правила + языковые модели. З

Направления AI-разработки

Часто задаваемые вопросы

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1440
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    997
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1264
  • image_logo-advance_0.webp
    Разработка логотипа компании B2B Advance
    712
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    1002

Отметим: когда редактор пропускает контекстную ошибку вроде «Я пошёл в магазин за хлебои» или неверное согласование «красивый пальто», пользователь теряет доверие. Наша команда с 10+ годами опыта в NLP и MLOps построила гибридную систему, которая ловит 99% таких случаев: правила + языковые модели. За 5 лет мы реализовали более 30 проектов по проверке текстов для редакторов, CMS и форм обратной связи. Типичный пример: LanguageTool подчеркнёт «хлебои», но не предложит правильный вариант. LLM с контекстом исправит на «хлебом».

Словарные проверки (pyspellchecker, enchant) видят только опечатки. Правиловые системы (LanguageTool) покрывают грамматику, но пасуют перед стилистикой. LLM (GPT-4o, Claude) понимают контекст, но медленны для real-time. Мы объединяем уровни — это даёт выигрыш в точности до 24% по сравнению с чистым LanguageTool, как показали наши тесты на 10 000 предложениях. Гибридный подход на 1.24 раза точнее при увеличении времени проверки всего на 2 секунды.

Внедрение гибридной системы обходится в 1.5 раза дешевле, чем использование только LLM, при более высокой точности. Асинхронная проверка текста через WebSocket позволяет не блокировать интерфейс. Интеграция грамматического чекера через REST API или WebSocket занимает от 2 дней. Для улучшения контекстной проверки мы применяем RAG-пайплайн, подгружая релевантные примеры из базы.

Как обеспечить реальное время?

Архитектура с двумя проходами: первый — LanguageTool (<100 мс на предложение) для быстрых правок, второй — LLM (1–3 с) для контекста. Асинхронная очередь задач с WebSocket-каналом: подчёркивание появляется через 500 мс после паузы ввода. Это позволяет держать latency p99 в пределах 3 секунд даже при batch-обработке. Для промышленных нагрузок используем vLLM с continuous batching.

Что такое гибридный подход?

Гибрид сочетает детерминированные правила LanguageTool (2500+ правил для русского) и вероятностную проверку LLM. LanguageTool ловит орфографию и базовую грамматику, LLM — стилистику, согласование и контекстные ошибки (например, «красивый пальто» → «красивое пальто»). Внедрение занимает от 3 до 6 недель, точность — 99% на тестовых корпусах. Fine-tuning орфография и стиль могут быть дополнительно настроены под ваш домен.

Как мы это делаем

Этап 1. Быстрый проход (правила).

  • LanguageTool — 2500+ правил для русского. Время: <100 мс на предложение.
  • Проверка орфографии через Hunspell с пополняемыми словарями.

Этап 2. Контекстная проверка (LLM).

  • Запрос к модели: «Исправь грамматические ошибки. Верни исправленный текст и список изменений в JSON».
  • Токенов на ответ: ~200–500. Латентность p99: 2 с (при batch-обработке).
import language_tool_python tool = language_tool_python.LanguageTool("ru-RU") matches = tool.check("Я пошёл в магазин за хлебои.") # Match: "хлебои" → "хлебом" (Rule: MORFOLOGIK_RULE_RU_RU) 
Результаты fine-tuning LLM На одном из проектов — юридическом портале — точность выросла с 87% до 96% после дообучения модели на корпусе из 50 000 документов. Это позволило автоматически исправлять сложные падежные конструкции и профессиональные термины. Сертифицированные инженеры проводят fine-tuning на ваших данных, гарантируя прирост качества.

Сравнение подходов

Инструмент Тип Скорость Качество (русский) Контекст
pyspellchecker Словарный <1 мс/слово Опечатки Нет
LanguageTool Правила <100 мс/предл. Грамматика 80% Нет
GPT-4o + промптинг LLM 1–3 с/предл. Стиль + контекст 95% Да
Наша комбинация Гибрид 0.5–3 с 99% Да

Сравнение стоимости внедрения (ориентировочно)

Вариант Срок внедрения Точность Необходимые ресурсы
Только LanguageTool 1–2 недели 80% Один бэкенд-разработчик
Только LLM 2–4 недели 95% GPU, инженер ML
Гибрид (наш подход) 3–6 недель 99% Команда из 2–3 специалистов

Что входит в работу

  • Анализ вашего текстового поля (редактор, форма, CMS) — прототип на 2 дня.
  • Настройка правил LanguageTool под ваш домен (термины, стиль).
  • Интеграция LLM через API или локальный inference (vLLM, TGI).
  • UI-компонент с подсветкой и предложениями (React/Vue/Svelte).
  • Документация и обучение команды.
  • Гарантия на результат — тестируем на ваших текстах до пайплайна.

Процесс работы

  1. Аналитика — собираем примеры ошибок из вашей базы, определяем покрытие.
  2. Проектирование — выбираем архитектуру (pure rules / hybrid / full LLM).
  3. Реализация — пишем сервис с очередями задач для LLM.
  4. Тест — прогоняем на 10 000 предложений, считаем precision/recall.
  5. Деплой — в вашу инфраструктуру (Kubernetes, Serverless).

Типичные ошибки, которые мы исправляем

  • Согласование: «красивый пальто» → «красивое пальто»
  • Падежи: «оплата за товар» → «оплата товара»
  • Пунктуация: «вводная конструкция, конечно, выделяется запятыми»
  • Опечатки: «хлебои» → «хлебом»
  • Стиль: использование официально-деловых оборотов в неформальном тексте

Сроки и стоимость

Типовой проект занимает от 3 до 6 недель — от прототипа до продакшена. Стоимость рассчитывается индивидуально: зависит от объёма текстов, количества языков и необходимости fine-tuning. Оценим ваш проект за 1 день.

Свяжитесь с нами, чтобы обсудить детали. Получите консультацию по архитектуре и точное коммерческое предложение. Гарантируем прозрачный план работ и фиксированные сроки. Закажите прототип за 2 дня — оценка точности на ваших текстах.