AI-система детекции сгенерированных текстов для учебных заведений

Университет столкнулся с лавиной работ, написанных ChatGPT. Традиционные детекторы давали 40% ложноположительных срабатываний, что приводило к конфликтам со студентами. Мы спроектировали ансамблевую AI-систему детекции сгенерированных текстов, которая снизила ложные срабатывания до 5% при точности 9

Направления AI-разработки

Часто задаваемые вопросы

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1441
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1302
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    998
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1267
  • image_logo-advance_0.webp
    Разработка логотипа компании B2B Advance
    714
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    1006

Университет столкнулся с лавиной работ, написанных ChatGPT. Традиционные детекторы давали 40% ложноположительных срабатываний, что приводило к конфликтам со студентами. Мы спроектировали ансамблевую AI-систему детекции сгенерированных текстов, которая снизила ложные срабатывания до 5% при точности 95%. Система анализирует не один, а три независимых сигнала, что делает её устойчивой к обфускации и перефразированию. В одном из пилотов мы обнаружили, что GPTZero пропускал 20% AI-текстов после лёгкого редактирования — наш ансамбль выявил их все. Экономия для вуза с потоком 5000 студентов может составить до $18k–26k в год на проверке работ. Для вуза с 10 000 студентов ежегодная экономия превышает $36k–52k.

Почему одного детектора недостаточно?

Основная сложность — отличить текст, полностью сгенерированный AI, от текста, где AI использовался легально (коррекция, поиск идей). Одного классификатора недостаточно: GPTZero даёт до 20% ошибок на академических текстах, а анализ перплексии легко обмануть заменой редких слов. Наш подход комбинирует статистические и ML-методы.

Статистические сигналы

  • Перплексия. Модель вычисляет, насколько каждое слово предсказуемо для языковой модели. Низкая перплексия — признак AI. Мы используем локальную модель на базе LLaMA 3, что обеспечивает конфиденциальность данных. Перплексия — мера предсказуемости текста, используемая в NLP.
  • Burstiness. Человек пишет неравномерно: то длинные, то короткие предложения. AI же генерирует предложения схожей длины. Burstiness-метрика фиксирует это отклонение.

Семантические сигналы

  • Структура. AI-тексты часто следуют шаблону: тезис — аргументы — вывод, без отступлений. Мы обучаем классификатор на парах "человеческий текст / AI-текст" с учётом специфики учебных работ.
  • Характерные фразы. Маркеры вроде «Важно отметить», «Это фундаментальный вопрос» — их избыток повышает confidence системы.

Как ансамбль повышает точность?

Объединение сигналов даёт выигрыш в точности на 10-15% по сравнению с одиночными классификаторами. Ансамблевый метод превосходит GPTZero в 2,3 раза по точности на текстах гуманитарных дисциплин. В проекте для МГУ мы столкнулись с тем, что студенты использовали GPT-4 с инструкцией писать как студент. Наша система выявила аномалии в структуре аргументов, повысив точность до 97%.

Метод Точность Ложные срабатывания Устойчивость к обходу
GPTZero ~85% 15-20% Низкая
Перплексия (одна) ~70% 10-12% Средняя
Burstiness ~60% 8-10% Высокая
Ансамбль (наш) 95% <5% Очень высокая

Как настроить детектор за 4 шага?

  1. Сбор референсной выборки: соберите 1000+ работ студентов (с согласия) и 1000+ AI-сгенерированных текстов по вашим темам.
  2. Калибровка порогов: запустите ансамбль на выборке, подберите порог confidence так, чтобы ложные срабатывания не превышали 5%.
  3. Интеграция с LMS: подключите API к Moodle или Canvas — загружайте работы и получайте результаты детекции автоматически.
  4. Обучение преподавателей: проведите вебинар, на котором разберёте кейсы серой зоны и порядок апелляций.

Ансамблевый подход

Код ниже демонстрирует ядро системы — агрегацию трёх сигналов.

class AIContentDetectionResult(BaseModel): is_ai_generated: bool confidence: float signals: list[DetectionSignal] human_review_required: bool evidence: str def detect_ai_content(text: str) -> AIContentDetectionResult: signals = [] # Сигнал 1: GPTZero API gptzero_score = gptzero_api.classify(text) signals.append(DetectionSignal("gptzero", gptzero_score)) # Сигнал 2: Perplexity через локальную модель perplexity = compute_perplexity(text) signals.append(DetectionSignal("perplexity", normalize_perplexity(perplexity))) # Сигнал 3: Burstiness burstiness = compute_burstiness(text) signals.append(DetectionSignal("burstiness", 1 - burstiness)) # Агрегация avg_signal = weighted_average(signals) return AIContentDetectionResult( is_ai_generated=avg_signal > 0.7, confidence=avg_signal, signals=signals, human_review_required=0.5 < avg_signal < 0.85, evidence=generate_evidence_report(signals, text) ) 

Если confidence попадает в серую зону (0.5–0.85), система требует ручной проверки. Это снижает риск ошибочных обвинений.

Пример отчёта по результатам детекции

Для каждого текста формируется отчёт с указанием confidence по каждому сигналу, примеры предложений-маркеров и рекомендации для преподавателя. Это позволяет аргументировать решение при апелляциях.

Что входит в проект разработки AI-детектора?

  • Анализ требований и политики учебного заведения
  • Выбор и обучение ансамблевой модели (LLaMA 3, GPTZero, кастомные классификаторы)
  • Интеграция с LMS (Moodle, Canvas, Blackboard)
  • Разработка панели администратора и отчётов
  • Документация и обучение преподавателей
  • Гарантийная поддержка 6 месяцев

Этапы разработки

Этап Длительность Результат
Анализ требований 1 неделя Описание политики, типов заданий, языковых особенностей
Выбор архитектуры 1-2 недели Подбор моделей (LLaMA 3, GPTZero, кастомные классификаторы), настройка порогов
Реализация пайплайна 2-4 недели Сбор данных, обучение моделей, интеграция в LMS (Moodle, Canvas, Blackboard)
Тестирование и доработка 1-2 недели Отчёт по accuracy на ваших данных, методика апелляций
Внедрение и обучение 1 неделя Инструкции для преподавателей, вебинары, разбор кейсов

Экономическая эффективность

Система позволяет сэкономить до 50% времени преподавателя на проверке работ. Затраты на обработку одной работы составляют менее доллара, что при потоке 10 000 работ даёт годовую экономию более $36k–52k. Мы имеем 7+ лет опыта в NLP и реализовали 15 проектов детекции для университетов РФ и СНГ. Гарантируем точность не ниже 90% на ваших данных.

Порядок подключения

Свяжитесь с нами для оценки вашего проекта. Мы проведём бесплатный пилот на выборке из 1000 работ и покажем реальную точность. Закажите консультацию по внедрению уже сегодня.