Реалізація виявлення AI-згенерованого тексту
Хибні спрацювання в академічних текстах — головний біль детекції. Студентські роботи з формальним стилем часто помилково позначаються як AI-generated. В одному з кейсів EdTech клієнт стикався з 20% хибних спрацювань на юридичних документах, що призводило до масових апеляцій. Ми перенавчили модель на корпусі юридичних текстів і знизили FP до 4%, застосувавши комбінацію статистичних методів та fine-tuned детектора. Система обробляє 50 тис. текстів на день з latency <200 мс (p99). Наша мета — адаптувати детектор під ваш домен, щоб мінімізувати false positive і зберегти високу точність.
Як детектори відрізняють AI-текст від людського?
Методи поділяються на три категорії. Статистичні базуються на perplexity та burstiness. Perplexity — міра передбачуваності: AI-текст більш гладкий. Детальніше про перплексію. Burstiness відображає варіативність довжини речень: у людини вона вища, у AI — нижча. Fine-tuned детектори, наприклад roberta-base-openai-detector, навчаються на семплах GPT. Проблема: високий false positive для нейтральних академічних текстів. Ми вирішуємо це аугментацією та калібруванням threshold під ваш датасет. Водяні знаки (watermarking) вбудовують статистичний патерн у токени при генерації — їх складно обійти, але потрібна підтримка на стороні LLM.
| Метод | Принцип | Точність на англ. | False positive | Складність обходу |
|---|---|---|---|---|
| Статистичний | Perplexity і burstiness | 70–80% | 15–25% | Низька |
| Водяні знаки | Статистичний патерн токенів | 95%+ (якщо підтримка) | <1% | Середня |
| Fine-tuned | Модель, навчена на AI-текстах | 85–95% | 5–15% | Висока |
Як підвищити точність детекції?
Комбінація методів дає синергію. Fine-tuned детектори дають точність 85-95%, що на 10% вище статистичних на цільовому домені. Однак водяні знаки забезпечують стійкість до обходу. Ми рекомендуємо трирівневий підхід:
- Статистичний фільтр (perplexity + burstiness) — швидке відбракування очевидних випадків.
- Fine-tuned модель — глибока класифікація з калібруванням порогу.
- Водяні знаки (якщо генератор підтримує) — остаточна верифікація.
На одному проекті в EdTech ми знизили хибні спрацювання з 12% до 3% за рахунок додавання мета-даних (час генерації, джерело) та калібрування порогу перплексії. Результат — стабільна робота на 50 тис. текстів на день. Економія на ручній перевірці контенту склала 2,5 раза.
Порівняння точності за доменами
| Домен | Статистичний | Fine-tuned | Watermark |
|---|---|---|---|
| Новини | 75% | 90% | 98% |
| Академічний | 65% | 85% | 95% |
| Юридичний | 70% | 88% | 96% |
| Медичний | 72% | 87% | 94% |
Fine-tuned модель на RoBERTa дає стабільний приріст точності на 12-15% відносно статистики на доменах з формальним стилем. При цьому на медичних текстах false positive знижується з 20% до 6% після калібрування.
Які обмеження потрібно врахувати?
False positive rate у кращих детекторів — 5–15% на людських текстах. Академічний та юридичний стилі — зона ризику. Перефразування через іншу LLM (наприклад, LLaMA або Mistral) оминає більшість методів. Для підвищення стійкості додавайте логи генерації та часові мітки — це знижує FP ще на 2-3%. Детекцію варто використовувати як один із сигналів, а не єдиний критерій. Наш досвід: десятки проектів з NLP, понад 30 впроваджень. Гарантуємо зниження false positive щонайменше на 30% відносно базових моделей.
Як ми оптимізуємо продуктивність?
Для high-load сценаріїв використовуємо quantization (INT8) та ONNX Runtime. vLLM з continuous batching дає пропускну здатність 100+ запитів на секунду на одному GPU (A100). Латенсі p99 утримуємо в межах 200 мс навіть при batch-обробці. Model card фіксує метрики: precision, recall, F1 для кожного домену. MLOps з MLflow дозволяє відстежувати дрейф даних і перекалібровувати threshold.
Що входить в нашу роботу
- Аналіз вашого датасету: збір репрезентативної вибірки людських та AI-текстів.
- Вибір та налаштування моделі: комбінація статистики + fine-tuned з урахуванням мови та стилю.
- Розгортання: API з latency <200 мс (p99) для потокової обробки.
- Документація та навчання: передаємо model card, інструкцію з оновлення.
- Підтримка: фікс хибних спрацювань за вашим зворотним зв'язком протягом 3 місяців.
Замовте пілотну інтеграцію — оцінимо ваш кейс за 2 дні. Отримайте консультацію щодо вибору стратегії детекції. Зв'яжіться з нами — ми допоможемо підібрати оптимальне рішення під ваш бюджет та завдання.
OpenAI Detector, Kirchenbauer et al. Watermarking LLM







