Реализация обнаружения AI-сгенерированного текста
Ложные срабатывания в академических текстах — главная боль детекции. Студенческие работы с формальным стилем часто ошибочно помечаются как AI-generated. В одном из кейсов EdTech клиент сталкивался с 20% ложных срабатываний на юридических документах, что приводило к массовым апелляциям. Мы переобучили модель на корпусе юридических текстов и снизили FP до 4%, применив комбинацию статистических методов и fine-tuned детектора. Система обрабатывает 50 тыс. текстов в день с latency <200 мс (p99). Наша цель — адаптировать детектор под ваш домен, чтобы минимизировать false positive и сохранить высокую точность.
Как детекторы отличают AI-текст от человеческого?
Методы делятся на три категории. Статистические основаны на perplexity и burstiness. Perplexity — мера предсказуемости: AI-текст более гладкий. Подробнее о перплексии. Burstiness отражает вариативность длины предложений: у человека она выше, у AI — ниже. Fine-tuned детекторы, например roberta-base-openai-detector, обучаются на сэмплах GPT. Проблема: высокий false positive для нейтральных академических текстов. Мы решаем это аугментацией и калибровкой threshold под ваш датасет. Водяные знаки (watermarking) встраивают статистический паттерн в токены при генерации — их сложно обойти, но требуется поддержка на стороне LLM.
| Метод | Принцип | Точность на англ. | False positive | Сложность обхода |
|---|---|---|---|---|
| Статистический | Perplexity и burstiness | 70–80% | 15–25% | Низкая |
| Водяные знаки | Статистический паттерн токенов | 95%+ (если поддержка) | <1% | Средняя |
| Fine-tuned | Модель, обученная на AI-текстах | 85–95% | 5–15% | Высокая |
Как повысить точность детекции?
Комбинация методов даёт синергию. Fine-tuned детекторы дают точность 85-95%, что на 10% выше статистических на целевом домене. Однако водяные знаки обеспечивают устойчивость к обходу. Мы рекомендуем трёхуровневый подход:
- Статистический фильтр (perplexity + burstiness) — быстрая отбраковка очевидных случаев.
- Fine-tuned модель — глубокая классификация с калибровкой порога.
- Водяные знаки (если генератор поддерживает) — окончательная верификация.
На одном проекте в EdTech мы снизили ложные срабатывания с 12% до 3% за счёт добавления мета-данных (время генерации, источник) и калибровки порога перплексии. Результат — стабильная работа на 50 тыс. текстов в день. Экономия на ручной проверке контента составила 2,5 раза.
Сравнение точности по доменам
| Домен | Статистический | Fine-tuned | Watermark |
|---|---|---|---|
| Новости | 75% | 90% | 98% |
| Академический | 65% | 85% | 95% |
| Юридический | 70% | 88% | 96% |
| Медицинский | 72% | 87% | 94% |
Fine-tuned модель на RoBERTa даёт стабильный прирост точности на 12-15% относительно статистики на доменах с формальным стилем. При этом на медицинских текстах false positive снижается с 20% до 6% после калибровки.
Какие ограничения нужно учесть?
False positive rate у лучших детекторов — 5–15% на человеческих текстах. Академический и юридический стили — зона риска. Перефразирование через другую LLM (например, LLaMA или Mistral) обходит большинство методов. Для повышения устойчивости добавляйте логи генерации и временные метки — это снижает FP ещё на 2-3%. Детекцию стоит использовать как один из сигналов, а не единственный критерий. Наш опыт: 5 лет на рынке AI-решений, 30+ проектов по NLP. Гарантируем снижение false positive минимум на 30% относительно базовых моделей.
Как мы оптимизируем производительность?
Для high-load сценариев используем quantization (INT8) и ONNX Runtime. vLLM с continuous batching даёт пропускную способность 100+ запросов в секунду на одном GPU (A100). Латенси p99 удерживаем в пределах 200 мс даже при batch-обработке. Model card фиксирует метрики: precision, recall, F1 для каждого домена. MLOps с MLflow позволяет отслеживать дрейф данных и перекалибровывать threshold.
Что входит в нашу работу
- Анализ вашего датасета: сбор репрезентативной выборки человеческих и AI-текстов.
- Выбор и настройка модели: комбинация статистики + fine-tuned с учётом языка и стиля.
- Развёртывание: API с latency <200 мс (p99) для потоковой обработки.
- Документация и обучение: передаём model card, инструкцию по обновлению.
- Поддержка: фикс ложных срабатываний по вашей обратной связи в течение 3 месяцев.
Закажите пилотную интеграцию — оценим ваш кейс за 2 дня. Получите консультацию по выбору стратегии детекции. Свяжитесь с нами — мы поможем подобрать оптимальное решение под ваш бюджет и задачи.
OpenAI Detector, Kirchenbauer et al. Watermarking LLM







