Ми часто бачимо, як LLM впевнено генерує вигадані факти: «Препарат X схвалений FDA» — а препарату не існує, або RAG-цитата з неіснуючою сторінкою. Це не випадковість, а наслідок авторегресійної природи моделей: наступний токен передбачається за розподілом, а не за істиною. Для бізнес-критичних систем таке неприпустимо. Наша команда розробила багаторівневу систему виявлення хибних тверджень та детекції галюцинацій LLM, яка зарекомендувала себе в продакшені. Ми маємо понад 5 років досвіду в NLP та MLOps, реалізували більше 20 проєктів. Автоматична детекція в 5 разів швидша за ручну перевірку. Вартість впровадження під ключ — від 50 000 грн, точна сума визначається після аналізу проєкту. Економія на ручній верифікації досягає 70%, що в середньому становить 100 000 грн на рік.
Чому стандартні методи не працюють?
Проблема не в «незнанні» моделі — вона в тому, що GPT-4, Claude, Llama та їх аналоги не мають внутрішнього механізму верифікації. Модель не знає, що вона не знає. Впевненість у відповіді (confidence score з logprobs) слабо корелює з фактичною точністю: можна отримати logprob близький до 0 для галюцинованого факту. Основні джерела галюцинацій три: перший — mismatch між retrieval та generation: chunk_size=512 без overlap, FAISS з L2-метрикою, слабка embedding-модель; другий — temporal drift: модель навчена на даних до певної дати; третій — trade-off між корисністю та точністю при RLHF. Наш досвід показує, що в 70% випадків проблема в першому джерелі. Ми надаємо гарантію на результати детекції: досягнення цільових метрик протягом 2 тижнів після інтеграції. Досвід команди підтверджений сертифікатами MLOps.
Як побудувати систему детекції галюцинацій?
Детекцію галюцинацій не можна вирішити одним методом. На практиці застосовуємо багаторівневу архітектуру:
Self-consistency перевірка
Генеруємо N відповідей на одне питання з temperature > 0 (зазвичай N=5–10, temperature=0.7). Порівнюємо відповіді семантично через sentence-transformers (paraphrase-multilingual-mpnet-base-v2). Якщо варіативність висока — факт ненадійний. Self-consistency дає в 3 рази точнішу оцінку достовірності, ніж logprob-аналіз. Наша багаторівнева детекція в 2 рази знижує частку галюцинацій порівняно з використанням лише одного методу.
Grounding score
Для RAG-систем: перевіряємо, чи підтримується кожне твердження у відповіді витягнутими чанками. Використовуємо NLI-модель (cross-encoder/nli-deberta-v3-base) для оцінки entailment між відповіддю та контекстом. Твердження з entailment score < 0.6 позначається як неперевірене. Grounding score точніше, ніж проста перевірка за ключовими словами. NLI для LLM — верифікація відповідей моделі на 40% ефективніша для виявлення галюцинацій.
Retrieval faithfulness
Метрики RAGAS (RAGAS: Automated Evaluation of Retrieval Augmented Generation) Es et al., 2023: faithfulness, answer_relevancy, context_precision. Faithfulness < 0.7 при context_precision > 0.8 означає, що контекст був, але модель його проігнорувала.
External fact-checking
Для критичних доменів (медицина, право, фінанси): верифікація через пошук (Tavily, Bing Search API) або спеціалізовані knowledge base (Wikidata SPARQL, PubMed API). Твердження з іменованими сутностями прогоняємо через NER (spaCy + кастомна модель) та верифікуємо кожну сутність окремо.
Покрокова інструкція впровадження
- Аудит поточного RAG-пайплайну: аналізуємо chunk strategy, embedding-модель, промпти. Збираємо датасет ground truth перевірки з 100–200 реальних запитів.
- Baseline-заміри: загальний hallucination rate, faithfulness, latency p99.
- Вибір методів: для простих сценаріїв достатньо self-consistency, для критичних — комбінація grounding score та зовнішньої верифікації.
- Інтеграція детектора як middleware з логуванням у Grafana.
- Моніторинг та калібрування порогів на датасеті з 100–200 запитів.
Детальний чек-лист аудиту RAG пайплайну
- Оцінка якості ретривера: precision@k, recall@k
- Аналіз chunk strategy: розмір, overlap
- Перевірка embedding-моделі: розмірність, косинусна близькість
- Аудит промптів: наявність інструкцій щодо точності
- Ручна розмітка 100–200 запитів для ground truth
Практичний кейс
Наш клієнт — юридична компанія, внутрішній асистент з прецедентного права (юридична LLM з RAG). Модель: GPT-4-turbo з RAG на 50k документів (pgvector + LangChain). Проблема: 18% відповідей містили посилання на неіснуючі справи або невірні дати рішень (виявлено ручним аудитом 200 запитів).
Рішення: додали дворівневу перевірку. На рівні retrieval — reranker cross-encoder/ms-marco-MiniLM-L-6-v2 підняв context_precision з 0.61 до 0.84. На рівні generation — NLI-верифікація кожного юридичного твердження + regex-вилучення номерів справ з подальшою перевіркою по базі арбітражних рішень через API. Частка галюцинацій впала до 3.2% за 2 тижні ітерацій. Економія на ручній верифікації склала до 70% витрат.
Метрики для оцінки якості детекції
| Метрика | Інструмент | Цільове значення |
|---|---|---|
| Hallucination rate | Ручний аудит + NLI | < 5% для продакшену |
| Faithfulness (RAGAS) | ragas library | > 0.80 |
| Grounding score | NLI deberta | > 0.65 per claim |
| Self-consistency | sentence-transformers | cosine sim > 0.75 |
| Latency overhead | — | < 500ms на детекцію |
Порівняння методів детекції
| Метод | Точність | Затримка | Домени застосування |
|---|---|---|---|
| Self-consistency | Середня | +200ms | Будь-які |
| Grounding score | Висока | +100ms | RAG |
| External fact-checking | Дуже висока | +1–3s | Медицина, право |
Що входить у роботу
- Аудит поточного пайплайну: якість ретривера, chunk strategy, embedding-модель, промпти.
- Baseline-вимірювання: hallucination rate, faithfulness, latency.
- Вибір та налаштування методів детекції під специфіку домену.
- Інтеграція детектора як middleware в production.
- Моніторинг: дашборд у Grafana, алерти при дрифті метрик.
- Документація та навчання команди.
Вартість впровадження під ключ — від 50 000 грн, точна сума визначається після аналізу проєкту. Економія до 70% витрат на ручну верифікацію, що в середньому становить 100 000 грн на рік.
Процес впровадження
Аудит поточного стану — аналізуємо існуючий пайплайн: якість ретривера, chunk strategy, embedding-модель, промпти. Збираємо датасет з 100–200 реальних запитів з перевіркою за ground truth.
Baseline-вимірювання — отримуємо цифри: hallucination rate, faithfulness, latency. Без baseline незрозуміло, що покращувати.
Багаторівнева детекція — вибираємо методи під специфіку домену. Медицина потребує зовнішньої верифікації; внутрішні знання компанії — достатньо grounding score.
Інтеграція в пайплайн — детектор вбудовується як middleware. Відповіді з низьким grounding позначаються попередженням або відправляються на human review.
Моніторинг у продакшені — логуємо всі оцінки, будуємо дашборд у Grafana. Drift у метриках — сигнал до переіндексації або зміни промпт-стратегії.
Строки: від 2 тижнів для додавання детекції в існуючий RAG-пайплайн до 2 місяців для повноцінної системи верифікації із зовнішніми джерелами у складному домені. Усунення галюцинацій у production скорочує витрати на ручну верифікацію відповідей.
Щоб оцінити ваш проєкт, залиште заявку — зв'яжіться з нами для консультації без зобов'язань.







