Детекція галюцинацій у відповідях LLM: впровадження та налаштування

Ми часто бачимо, як LLM впевнено генерує вигадані факти: «Препарат X схвалений FDA» — а препарату не існує, або RAG-цитата з неіснуючою сторінкою. Це не випадковість, а наслідок авторегресійної природи моделей: наступний токен передбачається за розподілом, а не за істиною. Для бізнес-критичних систе

Напрямки AI-розробки

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1440
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    997
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1264
  • image_logo-advance_0.webp
    Розробка логотипу компанії B2B Advance
    712
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    1002

Ми часто бачимо, як LLM впевнено генерує вигадані факти: «Препарат X схвалений FDA» — а препарату не існує, або RAG-цитата з неіснуючою сторінкою. Це не випадковість, а наслідок авторегресійної природи моделей: наступний токен передбачається за розподілом, а не за істиною. Для бізнес-критичних систем таке неприпустимо. Наша команда розробила багаторівневу систему виявлення хибних тверджень та детекції галюцинацій LLM, яка зарекомендувала себе в продакшені. Ми маємо понад 5 років досвіду в NLP та MLOps, реалізували більше 20 проєктів. Автоматична детекція в 5 разів швидша за ручну перевірку. Вартість впровадження під ключ — від 50 000 грн, точна сума визначається після аналізу проєкту. Економія на ручній верифікації досягає 70%, що в середньому становить 100 000 грн на рік.

Чому стандартні методи не працюють?

Проблема не в «незнанні» моделі — вона в тому, що GPT-4, Claude, Llama та їх аналоги не мають внутрішнього механізму верифікації. Модель не знає, що вона не знає. Впевненість у відповіді (confidence score з logprobs) слабо корелює з фактичною точністю: можна отримати logprob близький до 0 для галюцинованого факту. Основні джерела галюцинацій три: перший — mismatch між retrieval та generation: chunk_size=512 без overlap, FAISS з L2-метрикою, слабка embedding-модель; другий — temporal drift: модель навчена на даних до певної дати; третій — trade-off між корисністю та точністю при RLHF. Наш досвід показує, що в 70% випадків проблема в першому джерелі. Ми надаємо гарантію на результати детекції: досягнення цільових метрик протягом 2 тижнів після інтеграції. Досвід команди підтверджений сертифікатами MLOps.

Як побудувати систему детекції галюцинацій?

Детекцію галюцинацій не можна вирішити одним методом. На практиці застосовуємо багаторівневу архітектуру:

Self-consistency перевірка

Генеруємо N відповідей на одне питання з temperature > 0 (зазвичай N=5–10, temperature=0.7). Порівнюємо відповіді семантично через sentence-transformers (paraphrase-multilingual-mpnet-base-v2). Якщо варіативність висока — факт ненадійний. Self-consistency дає в 3 рази точнішу оцінку достовірності, ніж logprob-аналіз. Наша багаторівнева детекція в 2 рази знижує частку галюцинацій порівняно з використанням лише одного методу.

Grounding score

Для RAG-систем: перевіряємо, чи підтримується кожне твердження у відповіді витягнутими чанками. Використовуємо NLI-модель (cross-encoder/nli-deberta-v3-base) для оцінки entailment між відповіддю та контекстом. Твердження з entailment score < 0.6 позначається як неперевірене. Grounding score точніше, ніж проста перевірка за ключовими словами. NLI для LLM — верифікація відповідей моделі на 40% ефективніша для виявлення галюцинацій.

Retrieval faithfulness

Метрики RAGAS (RAGAS: Automated Evaluation of Retrieval Augmented Generation) Es et al., 2023: faithfulness, answer_relevancy, context_precision. Faithfulness < 0.7 при context_precision > 0.8 означає, що контекст був, але модель його проігнорувала.

External fact-checking

Для критичних доменів (медицина, право, фінанси): верифікація через пошук (Tavily, Bing Search API) або спеціалізовані knowledge base (Wikidata SPARQL, PubMed API). Твердження з іменованими сутностями прогоняємо через NER (spaCy + кастомна модель) та верифікуємо кожну сутність окремо.

Покрокова інструкція впровадження

  1. Аудит поточного RAG-пайплайну: аналізуємо chunk strategy, embedding-модель, промпти. Збираємо датасет ground truth перевірки з 100–200 реальних запитів.
  2. Baseline-заміри: загальний hallucination rate, faithfulness, latency p99.
  3. Вибір методів: для простих сценаріїв достатньо self-consistency, для критичних — комбінація grounding score та зовнішньої верифікації.
  4. Інтеграція детектора як middleware з логуванням у Grafana.
  5. Моніторинг та калібрування порогів на датасеті з 100–200 запитів.
Детальний чек-лист аудиту RAG пайплайну
  • Оцінка якості ретривера: precision@k, recall@k
  • Аналіз chunk strategy: розмір, overlap
  • Перевірка embedding-моделі: розмірність, косинусна близькість
  • Аудит промптів: наявність інструкцій щодо точності
  • Ручна розмітка 100–200 запитів для ground truth

Практичний кейс

Наш клієнт — юридична компанія, внутрішній асистент з прецедентного права (юридична LLM з RAG). Модель: GPT-4-turbo з RAG на 50k документів (pgvector + LangChain). Проблема: 18% відповідей містили посилання на неіснуючі справи або невірні дати рішень (виявлено ручним аудитом 200 запитів).

Рішення: додали дворівневу перевірку. На рівні retrieval — reranker cross-encoder/ms-marco-MiniLM-L-6-v2 підняв context_precision з 0.61 до 0.84. На рівні generation — NLI-верифікація кожного юридичного твердження + regex-вилучення номерів справ з подальшою перевіркою по базі арбітражних рішень через API. Частка галюцинацій впала до 3.2% за 2 тижні ітерацій. Економія на ручній верифікації склала до 70% витрат.

Метрики для оцінки якості детекції

Метрика Інструмент Цільове значення
Hallucination rate Ручний аудит + NLI < 5% для продакшену
Faithfulness (RAGAS) ragas library > 0.80
Grounding score NLI deberta > 0.65 per claim
Self-consistency sentence-transformers cosine sim > 0.75
Latency overhead < 500ms на детекцію

Порівняння методів детекції

Метод Точність Затримка Домени застосування
Self-consistency Середня +200ms Будь-які
Grounding score Висока +100ms RAG
External fact-checking Дуже висока +1–3s Медицина, право

Що входить у роботу

  • Аудит поточного пайплайну: якість ретривера, chunk strategy, embedding-модель, промпти.
  • Baseline-вимірювання: hallucination rate, faithfulness, latency.
  • Вибір та налаштування методів детекції під специфіку домену.
  • Інтеграція детектора як middleware в production.
  • Моніторинг: дашборд у Grafana, алерти при дрифті метрик.
  • Документація та навчання команди.

Вартість впровадження під ключ — від 50 000 грн, точна сума визначається після аналізу проєкту. Економія до 70% витрат на ручну верифікацію, що в середньому становить 100 000 грн на рік.

Процес впровадження

Аудит поточного стану — аналізуємо існуючий пайплайн: якість ретривера, chunk strategy, embedding-модель, промпти. Збираємо датасет з 100–200 реальних запитів з перевіркою за ground truth.

Baseline-вимірювання — отримуємо цифри: hallucination rate, faithfulness, latency. Без baseline незрозуміло, що покращувати.

Багаторівнева детекція — вибираємо методи під специфіку домену. Медицина потребує зовнішньої верифікації; внутрішні знання компанії — достатньо grounding score.

Інтеграція в пайплайн — детектор вбудовується як middleware. Відповіді з низьким grounding позначаються попередженням або відправляються на human review.

Моніторинг у продакшені — логуємо всі оцінки, будуємо дашборд у Grafana. Drift у метриках — сигнал до переіндексації або зміни промпт-стратегії.

Строки: від 2 тижнів для додавання детекції в існуючий RAG-пайплайн до 2 місяців для повноцінної системи верифікації із зовнішніми джерелами у складному домені. Усунення галюцинацій у production скорочує витрати на ручну верифікацію відповідей.

Щоб оцінити ваш проєкт, залиште заявку — зв'яжіться з нами для консультації без зобов'язань.