Розробка AI-системи автоматичної перевірки завдань з рубрикативною оцінкою
Перевірка сотень есе або лабораторних робіт вручну — це десятки годин викладацького часу та неминуча суб'єктивність. Помилки втоми, різний калібр, пропущений плагіат — все це знижує якість зворотного зв'язку. Ми пропонуємо AI-систему Auto Grading, яка не просто ставить бали, а дає студенту розгорнутий зворотний зв'язок за кожним критерієм. З початку впровадження ми реалізували такі рішення в 20+ навчальних закладах, скоротивши час перевірки в середньому у 8 разів, а узгодженість оцінок з викладачами — до 93% (каппа Коена). Наша система пройшла аудит у двох акредитованих вишах — всі рекомендації враховано.
Як AI оцінює есе?
Система використовує рубрику — набір критеріїв з описом рівнів. Для кожного критерію LLM (Large Language Model, Wikipedia), наприклад, GPT-4o або Claude 3.5, аналізує текст, виділяє відповідності та виставляє бал з обґрунтуванням. Згідно з звітом про ефективність LLM в освіті, такий підхід знижує навантаження на викладачів. Результат — структурована оцінка: total_score, criteria_scores, feedback, strengths, improvements. Студент бачить цитати зі своєї роботи з поясненням, чому так оцінили.
Чому рубрика-based підхід працює точніше?
Без рубрики LLM може оцінювати суб'єктивно або пропускати важливі аспекти. Рубрика фіксує очікування, робить оцінку відтворюваною та зрозумілою. Критерії легко налаштовуються під будь-який курс — від фізики до програмування. В одному кейсі для вишу з 5000 студентів ми порівняли AI-оцінки з людськими: різниця в балах не перевищувала 0.5 за 10-бальною шкалою, а економія часу склала 400 годин за семестр.
Типи завдань та методи перевірки
| Тип завдання | Метод перевірки | Точність |
|---|---|---|
| Тест (вибір відповіді) | Детерміноване порівняння | 100% |
| Відкрите питання | Семантична схожість + LLM-оцінка | ~95% |
| Есе | Рубрика + LLM за критеріями | ~90% (узгодженість з викладачем) |
| Код | Юніт-тести + LLM (стиль, ефективність) | ~92% |
Приклад рубрики для есе з історії
| Критерій | Відмінно (3) | Добре (2) | Задовільно (1) |
|---|---|---|---|
| Розуміння контексту | Глибоке знання епохи | Основні факти вірні | Поверхневе знання |
| Аргументація | Чітка позиція з доказами | Логічні доводи, але немає посилань | Слабка аргументація |
| Структура | Стрункий вступ, тіло, висновок | Деякі логічні розриви | Хаотичний виклад |
Як ми це робимо: стек і кейс
Використовуємо зв'язку: Python + Pydantic для схем, LangChain для оркестрації LLM, Hugging Face Transformers для embeddings. LLM — OpenAI GPT-4o або Claude 3.5 Sonnet (вибір залежить від бюджету та вимог до latency).
Кейс: Для вишу з 5000 студентів ми розгорнули систему на Kubernetes з автоскейлінгом. Середній час перевірки есе — 2 секунди, p99 latency — 3.5 секунди. Узгодженість AI-оцінок з викладацькими — 93% (каппа Коена). За семестр зекономили 400 годин викладацького часу.
Процес роботи
- Аналітика: вивчаємо ваші завдання, критерії, поточні проблеми.
- Проектування: розробляємо рубрики, обираємо модель, налаштовуємо пайплайн.
- Реалізація: пишемо API, інтегруємо з LMS (Moodle, Canvas), додаємо адмінку для викладачів.
- Тестування: калібруємо на ваших даних, порівнюємо з ручними оцінками.
- Деплой та навчання: розгортаємо на вашій інфраструктурі або нашому хмарі, проводимо вебінар для викладачів.
Що входить до типового проекту
- Документація: архітектура, API, інструкції для викладачів.
- Адмінка: управління рубриками, перегляд логів, ручне коригування.
- Навчання: 2-годинний вебінар + запис.
- Підтримка: 2 місяці після запуску (Telegram/LMS-чат).
- Всі артефакти передаються замовнику: код, конфіги, навчені моделі.
Строки та вартість
Строки — від 3 тижнів для типового рішення до 2 місяців при кастомізації під конкретну LMS. Вартість проекту розраховується індивідуально та залежить від обсягу завдань і інтеграції. Оцінимо ваш проект за 1 день — зв'яжіться для консультації.
Ми гарантуємо прозорість: ви завжди бачите, як AI прийшов до оцінки, і можете втрутитися в будь-який момент. Отримайте консультацію інженера: обговоримо ваші завдання та покажемо демо на реальних даних. Замовте пробну перевірку 100 робіт — переконайтеся в якості AI-оцінок. Отримайте попередню оцінку вартості вашого проекту.
Порівняння з ручною перевіркою
| Критерій | Ручна перевірка | AI-система |
|---|---|---|
| Час на 100 есе | ~40 годин | ~5 годин |
| Узгодженість оцінок | ~80% (різні викладачі) | ~93% (каппа Коена) |
| Об'єктивність | Залежить від втоми, настрою | Анонімізація, калібрування |
| Детальний зворотний зв'язок | Обмежений часом | Автоматично за критеріями |
AI-система у 8 разів швидше та на 15% точніше за узгодженістю (порівняння з усередненою ручною оцінкою).







