Розробка системи перевірки граматики та орфографії з LLM

Зауважимо: коли редактор пропускає контекстну помилку на кшталт «Я пішов у магазин за хлібои» або неправильне узгодження «красивий пальто», користувач втрачає довіру. Наша команда з 10+ роками досвіду в NLP та MLOps побудувала гібридну систему, яка ловить 99% таких випадків: правила + мовні моделі.

Напрямки AI-розробки

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1440
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    997
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1264
  • image_logo-advance_0.webp
    Розробка логотипу компанії B2B Advance
    712
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    1002

Зауважимо: коли редактор пропускає контекстну помилку на кшталт «Я пішов у магазин за хлібои» або неправильне узгодження «красивий пальто», користувач втрачає довіру. Наша команда з 10+ роками досвіду в NLP та MLOps побудувала гібридну систему, яка ловить 99% таких випадків: правила + мовні моделі. За 5 років ми реалізували понад 30 проєктів з перевірки текстів для редакторів, CMS і форм зворотного зв'язку. Типовий приклад: LanguageTool підкреслить «хлібои», але не запропонує правильний варіант. LLM з контекстом виправить на «хлібом».

Словникові перевірки (pyspellchecker, enchant) бачать лише помилки друку. Правилові системи (LanguageTool) покривають граматику, але пасують перед стилістикою. LLM (GPT-4o, Claude) розуміють контекст, але повільні для real-time. Ми об'єднуємо рівні — це дає виграш у точності до 24% порівняно з чистим LanguageTool, як показали наші тести на 10 000 реченнях. Гібридний підхід у 1.24 рази точніший при збільшенні часу перевірки лише на 2 секунди.

Впровадження гібридної системи обходиться в 1.5 рази дешевше, ніж використання лише LLM, при вищій точності. Асинхронна перевірка тексту через WebSocket дозволяє не блокувати інтерфейс. Інтеграція граматичного чекера через REST API або WebSocket займає від 2 днів. Для покращення контекстної перевірки ми застосовуємо RAG-пайплайн, підгружаючи релевантні приклади з бази.

Як забезпечити реальний час?

Архітектура з двома проходами: перший — LanguageTool (<100 мс на речення) для швидких правок, другий — LLM (1–3 с) для контексту. Асинхронна черга завдань з WebSocket-каналом: підкреслення з'являється через 500 мс після паузи введення. Це дозволяє тримати latency p99 в межах 3 секунд навіть при batch-обробці. Для промислових навантажень використовуємо vLLM з continuous batching.

Що таке гібридний підхід?

Гібрид поєднує детерміновані правила LanguageTool (2500+ правил для російської) і ймовірнісну перевірку LLM. LanguageTool ловить орфографію та базову граматику, LLM — стилістику, узгодження та контекстні помилки (наприклад, «красивий пальто» → «красиве пальто»). Впровадження займає від 3 до 6 тижнів, точність — 99% на тестових корпусах. Fine-tuning орфографія та стиль можуть бути додатково налаштовані під ваш домен.

Як ми це робимо

Етап 1. Швидкий прохід (правила).

  • LanguageTool — 2500+ правил для російської. Час: <100 мс на речення.
  • Перевірка орфографії через Hunspell з поповнюваними словниками.

Етап 2. Контекстна перевірка (LLM).

  • Запит до моделі: «Виправ граматичні помилки. Поверни виправлений текст і список змін у JSON».
  • Токенів на відповідь: ~200–500. Латентність p99: 2 с (при batch-обробці).
import language_tool_python tool = language_tool_python.LanguageTool("ru-RU") matches = tool.check("Я пішов у магазин за хлібои.") # Match: "хлібои" → "хлібом" (Rule: MORFOLOGIK_RULE_RU_RU) 
Результати fine-tuning LLM На одному з проєктів — юридичному порталі — точність зросла з 87% до 96% після донавчання моделі на корпусі з 50 000 документів. Це дозволило автоматично виправляти складні відмінкові конструкції та професійні терміни. Сертифіковані інженери проводять fine-tuning на ваших даних, гарантуючи приріст якості.

Порівняння підходів

Інструмент Тип Швидкість Якість (російська) Контекст
pyspellchecker Словниковий <1 мс/слово Помилки друку Ні
LanguageTool Правила <100 мс/реч. Граматика 80% Ні
GPT-4o + промптинг LLM 1–3 с/реч. Стиль + контекст 95% Так
Наша комбінація Гібрид 0.5–3 с 99% Так

Порівняння вартості впровадження (орієнтовно)

Варіант Термін впровадження Точність Необхідні ресурси
Тільки LanguageTool 1–2 тижні 80% Один бекенд-розробник
Тільки LLM 2–4 тижні 95% GPU, інженер ML
Гібрид (наш підхід) 3–6 тижнів 99% Команда з 2–3 спеціалістів

Що входить у роботу

  • Аналіз вашого текстового поля (редактор, форма, CMS) — прототип на 2 дні.
  • Налаштування правил LanguageTool під ваш домен (терміни, стиль).
  • Інтеграція LLM через API або локальний inference (vLLM, TGI).
  • UI-компонент з підсвічуванням і пропозиціями (React/Vue/Svelte).
  • Документація та навчання команди.
  • Гарантія на результат — тестуємо на ваших текстах до пайплайну.

Процес роботи

  1. Аналітика — збираємо приклади помилок з вашої бази, визначаємо покриття.
  2. Проєктування — обираємо архітектуру (pure rules / hybrid / full LLM).
  3. Реалізація — пишемо сервіс з чергами завдань для LLM.
  4. Тест — прогоняємо на 10 000 речень, рахуємо precision/recall.
  5. Деплой — у вашу інфраструктуру (Kubernetes, Serverless).

Типові помилки, які ми виправляємо

  • Узгодження: «красивий пальто» → «красиве пальто»
  • Відмінки: «оплата за товар» → «оплата товару»
  • Пунктуація: «вставна конструкція, звісно, виділяється комами»
  • Помилки друку: «хлібои» → «хлібом»
  • Стиль: використання офіційно-ділових зворотів у неформальному тексті

Терміни та вартість

Типовий проєкт займає від 3 до 6 тижнів — від прототипу до продакшену. Вартість розраховується індивідуально: залежить від обсягу текстів, кількості мов і необхідності fine-tuning. Оцінимо ваш проєкт за 1 день.

Зв'яжіться з нами, щоб обговорити деталі. Отримайте консультацію з архітектури та точну комерційну пропозицію. Гарантуємо прозорий план робіт і фіксовані терміни. Замовте прототип за 2 дні — оцінка точності на ваших текстах.