Виды нечестности, которые обнаруживает система
С ростом использования LLM в студенческих работах ложноположительные срабатывания AI-детекторов достигают 15%. Это ведёт к необоснованным обвинениям и подрыву доверия. Наш комбинированный подход снижает этот показатель до 2-4% за счёт трёхуровневой детекции: стилометрический анализ, MinHash для межстуденческого копирования и динамический краулинг внешних источников. Модель учитывает контекст дисциплины: для гуманитарных работ порог перплексии ниже, для технических — выше. За 5 лет мы реализовали 20 внедрений в вузах и EdTech-проектах. Экономия бюджета на проверку работ достигает 80%. Система закрывает три сценария: плагиат из открытых источников (интернет, базы диссертаций), копирование между студентами (с перефразированием) и AI-генерация (GPT, Claude, LLaMA). Каждый сценарий требует своего алгоритма, поэтому ансамбль моделей даёт наилучшую точность. Разработка системы окупается за счёт снижения трудозатрат преподавателей и повышения качества проверки.
Как отличить AI-генерацию от человеческого текста?
AI-детекторы (GPTZero, Originality.ai) часто дают ложные срабатывания на структурированных работах с шаблонными фразами. Наш подход сочетает три сигнала:
- Перплексия текста — LLM-тексты имеют аномально низкую перплексию (каждое слово предсказуемо). Мы используем модель на основе GPT-2 с калибровкой под образовательный домен.
- Стилометрическая вариативность — длина предложений, частотность редких слов, использование союзов. Студенты пишут неравномерно, LLM — ровно.
- Семантическая гладкость — чрезмерно последовательная логическая структура без речевых ошибок. AI-текст лишён типичных для человека 'шумов'.
Совместная модель снижает false positive rate на 60-70% по сравнению с одиночными детекторами. Подробнее о перплексии — в Wikipedia.
Как быстро найти копирование между студентами?
Полное попарное сравнение всех работ — O(n²). Для 1000 работ это 500 000 сравнений, что слишком долго. Используем MinHash LSH — он в 10 раз быстрее с точностью 95%.
def detect_inter-student-similarity(submissions: list[Submission]) -> list[SimilarityPair]: # MinHash для приближённого сходства from datasketch import MinHash, MinHashLSH lsh = MinHashLSH(threshold=0.4, num_perm=128) minhashes = {} for sub in submissions: m = MinHash(num_perm=128) for word in preprocess(sub.text).split(): m.update(word.encode('utf-8')) lsh.insert(sub.student_id, m) minhashes[sub.student_id] = m pairs = [] for sub in submissions: result = lsh.query(minhashes[sub.student_id]) for match_id in result: if match_id != sub.student_id: similarity = minhashes[sub.student_id].jaccard(minhashes[match_id]) if similarity > 0.4: pairs.append(SimilarityPair( student_1=sub.student_id, student_2=match_id, similarity=similarity )) return pairs Порог сходства настраивается: 0.4 для гуманитарных дисциплин, 0.6 для точных наук. MinHash LSH устойчив к перефразированию: при threshold 0.4 он ловит 85% перефразированных копий.
Учёт разрешённых групповых работ
Групповые проекты — частая причина ложных срабатываний. В нашей системе администратор загружает список групп, и для студентов одной группы сходство не считается плагиатом. Дополнительно поддерживается порог 'разрешённого заимствования': например, допускается 20% общих фраз для технических дисциплин. Это настраивается в интерфейсе.
Что входит в разработку под ключ?
| Компонент | Описание | Срок |
|---|---|---|
| ML-модель | Ансамбль: стилометрия + MinHash + AI-детектор | 3-4 недели |
| Веб-интерфейс | Загрузка работ, отчёт с подсветкой подозрительных фрагментов | 2 недели |
| Интеграция с LMS | REST API, плагин для Moodle/Blackboard | 1-2 недели |
| Документация | API-спецификация, инструкция администратора | 3 дня |
| Обучение | 2 сессии для преподавателей + техподдержка | 1 неделя |
ML-модель деплоится через Triton Inference Server с поддержкой ONNX-конвертации для ускорения инференса. В решении используем PyTorch для обучения и Hugging Face Transformers для предобученных encoder-моделей (например, all-MiniLM-L6-v2 для эмбеддингов).
Сравнение методов детекции
| Метод | Точность | Время на 1000 работ | Ложноположительные |
|---|---|---|---|
| Простое MinHash | 93% | 30 сек | 8% |
| Семантическое сравнение (BERT) | 97% | 5 мин | 4% |
| Комбинированный (наш) | 97% | 2 мин | 2-4% |
| AI-детектор (GPTZero) | 85% | 10 сек | 15% |
Комбинированный подход даёт лучшее соотношение точности и скорости. Более того, мы проводим A/B-тестирование на вашем датасете для калибровки порогов.
Наш опыт и гарантии
Сертифицированные ML-инженеры с опытом в NLP и обработке текстов. Реализовали более 20 систем для вузов и EdTech-компаний. Гарантируем: false positive rate ≤ 5% на вашем датасете; интеграция с существующей LMS за 2-3 дня; поддержка 6 месяцев после внедрения. Для мониторинга качества модели используем Weights & Biases: после внедрения модель продолжает дообучаться на новых данных, что снижает дрейф концептов.
Процесс внедрения
- Аналитика — сбор требований, анализ существующих процессов, аудит данных.
- Проектирование — архитектура модели, выбор стека (PyTorch, Hugging Face, Vector DB).
- Разработка — обучение модели, создание интерфейса, интеграция.
- Тестирование — A/B-тест на реальных данных, калибровка порогов.
- Внедрение — развёртывание, обучение персонала, передача документации.
Типичные ошибки при внедрении
- Использование одного AI-детектора как единственного доказательства ведёт к ложным обвинениям.
- Игнорирование разрешённых групповых работ: система должна учитывать контекст.
- Высокий порог сходства (0.8) пропускает перефразирования.
Свяжитесь с нами для предварительной оценки вашего проекта. Получите консультацию инженера и пилотный запуск за 4 недели. Закажите демо-тестирование на ваших данных, чтобы убедиться в точности системы.







