Університет зіткнувся з лавиною робіт, написаних ChatGPT. Традиційні детектори давали 40% хибнопозитивних спрацьовувань, що призводило до конфліктів зі студентами. Ми спроектували ансамблеву AI-систему детекції згенерованих текстів, яка знизила хибні спрацьовування до 5% при точності 95%. Система аналізує не один, а три незалежні сигнали, що робить її стійкою до обфускації та перефразування. В одному з пілотів ми виявили, що GPTZero пропускав 20% AI-текстів після легкого редагування — наш ансамбль виявив їх усі. Економія для вишу з потоком 5000 студентів може скласти до 800 тис. грн на рік на перевірці робіт. Для вишу з 10 000 студентів щорічна економія перевищує 1,6 млн грн.
Чому одного детектора недостатньо?
Основна складність — відрізнити текст, повністю згенерований AI, від тексту, де AI використовувався легально (корекція, пошук ідей). Одного класифікатора недостатньо: GPTZero дає до 20% помилок на академічних текстах, а аналіз перплексії легко обдурити заміною рідкісних слів. Наш підхід комбінує статистичні та ML-методи.
Статистичні сигнали
- Перплексія. Модель обчислює, наскільки кожне слово передбачуване для мовної моделі. Низька перплексія — ознака AI. Ми використовуємо локальну модель на базі LLaMA 3, що забезпечує конфіденційність даних. Перплексія — міра передбачуваності тексту, використовувана в NLP.
- Burstiness. Людина пише нерівномірно: то довгі, то короткі речення. AI ж генерує речення схожої довжини. Burstiness-метрика фіксує це відхилення.
Семантичні сигнали
- Структура. AI-тексти часто слідують шаблону: теза — аргументи — висновок, без відступів. Ми навчаємо класифікатор на парах "людський текст / AI-текст" з урахуванням специфіки навчальних робіт.
- Характерні фрази. Маркери на кшталт «Важно отметить», «Это фундаментальный вопрос» — їх надлишок підвищує confidence системи.
Як ансамбль підвищує точність?
Об'єднання сигналів дає виграш у точності на 10-15% порівняно з одиночними класифікаторами. Ансамблевий метод перевершує GPTZero у 2,3 рази за точністю на текстах гуманітарних дисциплін. У проекті для університету ми зіткнулися з тим, що студенти використовували GPT-4 з інструкцією писати як студент. Наша система виявила аномалії в структурі аргументів, підвищивши точність до 97%.
| Метод | Точність | Хибні спрацьовування | Стійкість до обходу |
|---|---|---|---|
| GPTZero | ~85% | 15-20% | Низька |
| Перплексія (одна) | ~70% | 10-12% | Середня |
| Burstiness | ~60% | 8-10% | Висока |
| Ансамбль (наш) | 95% | <5% | Дуже висока |
Як налаштувати детектор за 4 кроки?
- Збір референсної вибірки: зберіть 1000+ робіт студентів (за згодою) та 1000+ AI-згенерованих текстів за вашими темами.
- Калібрування порогів: запустіть ансамбль на вибірці, підберіть поріг confidence так, щоб хибні спрацьовування не перевищували 5%.
- Інтеграція з LMS: підключіть API до Moodle або Canvas — завантажуйте роботи та отримуйте результати детекції автоматично.
- Навчання викладачів: проведіть вебінар, на якому розберете кейси сірої зони та порядок апеляцій.
Ансамблевий підхід
Код нижче демонструє ядро системи — агрегацію трьох сигналів.
class AIContentDetectionResult(BaseModel): is_ai_generated: bool confidence: float signals: list[DetectionSignal] human_review_required: bool evidence: str def detect_ai_content(text: str) -> AIContentDetectionResult: signals = [] # Сигнал 1: GPTZero API gptzero_score = gptzero_api.classify(text) signals.append(DetectionSignal("gptzero", gptzero_score)) # Сигнал 2: Perplexity через локальну модель perplexity = compute_perplexity(text) signals.append(DetectionSignal("perplexity", normalize_perplexity(perplexity))) # Сигнал 3: Burstiness burstiness = compute_burstiness(text) signals.append(DetectionSignal("burstiness", 1 - burstiness)) # Агрегація avg_signal = weighted_average(signals) return AIContentDetectionResult( is_ai_generated=avg_signal > 0.7, confidence=avg_signal, signals=signals, human_review_required=0.5 < avg_signal < 0.85, evidence=generate_evidence_report(signals, text) ) Якщо confidence потрапляє в сіру зону (0.5–0.85), система вимагає ручної перевірки. Це знижує ризик помилкових звинувачень.
Приклад звіту за результатами детекції
Для кожного тексту формується звіт із зазначенням confidence за кожним сигналом, приклади речень-маркерів та рекомендації для викладача. Це дозволяє аргументувати рішення при апеляціях.
Що входить у проект розробки AI-детектора?
- Аналіз вимог та політики навчального закладу
- Вибір та навчання ансамблевої моделі (LLaMA 3, GPTZero, кастомні класифікатори)
- Інтеграція з LMS (Moodle, Canvas, Blackboard)
- Розробка панелі адміністратора та звітів
- Документація та навчання викладачів
- Гарантійна підтримка 6 місяців
Етапи розробки
| Етап | Тривалість | Результат |
|---|---|---|
| Аналіз вимог | 1 тиждень | Опис політики, типів завдань, мовних особливостей |
| Вибір архітектури | 1-2 тижні | Підбір моделей (LLaMA 3, GPTZero, кастомні класифікатори), налаштування порогів |
| Реалізація пайплайну | 2-4 тижні | Збір даних, навчання моделей, інтеграція в LMS (Moodle, Canvas, Blackboard) |
| Тестування та доопрацювання | 1-2 тижні | Звіт по accuracy на ваших даних, методика апеляцій |
| Впровадження та навчання | 1 тиждень | Інструкції для викладачів, вебінари, розбір кейсів |
Економічна ефективність
Система дозволяє заощадити до 50% часу викладача на перевірці робіт. Витрати на обробку однієї роботи становлять менше однієї гривні, що при потоці 10 000 робіт дає річну економію понад 1,6 млн грн. Ми маємо 7+ років досвіду в NLP та реалізували 15 проектів детекції для університетів України та СНД. Гарантуємо точність не нижче 90% на ваших даних.
Порядок підключення
Зв'яжіться з нами для оцінки вашого проекту. Ми проведемо безкоштовний пілот на вибірці з 1000 робіт і покажемо реальну точність. Замовте консультацію з впровадження вже сьогодні.







