Автоматична AI-перевірка завдань з рубрикативною оцінкою

Розробка AI-системи автоматичної перевірки завдань з рубрикативною оцінкою

Напрямки AI-розробки

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1443
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1302
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    998
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1267
  • image_logo-advance_0.webp
    Розробка логотипу компанії B2B Advance
    715
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    1006

Розробка AI-системи автоматичної перевірки завдань з рубрикативною оцінкою

Перевірка сотень есе або лабораторних робіт вручну — це десятки годин викладацького часу та неминуча суб'єктивність. Помилки втоми, різний калібр, пропущений плагіат — все це знижує якість зворотного зв'язку. Ми пропонуємо AI-систему Auto Grading, яка не просто ставить бали, а дає студенту розгорнутий зворотний зв'язок за кожним критерієм. З початку впровадження ми реалізували такі рішення в 20+ навчальних закладах, скоротивши час перевірки в середньому у 8 разів, а узгодженість оцінок з викладачами — до 93% (каппа Коена). Наша система пройшла аудит у двох акредитованих вишах — всі рекомендації враховано.

Як AI оцінює есе?

Система використовує рубрику — набір критеріїв з описом рівнів. Для кожного критерію LLM (Large Language Model, Wikipedia), наприклад, GPT-4o або Claude 3.5, аналізує текст, виділяє відповідності та виставляє бал з обґрунтуванням. Згідно з звітом про ефективність LLM в освіті, такий підхід знижує навантаження на викладачів. Результат — структурована оцінка: total_score, criteria_scores, feedback, strengths, improvements. Студент бачить цитати зі своєї роботи з поясненням, чому так оцінили.

Чому рубрика-based підхід працює точніше?

Без рубрики LLM може оцінювати суб'єктивно або пропускати важливі аспекти. Рубрика фіксує очікування, робить оцінку відтворюваною та зрозумілою. Критерії легко налаштовуються під будь-який курс — від фізики до програмування. В одному кейсі для вишу з 5000 студентів ми порівняли AI-оцінки з людськими: різниця в балах не перевищувала 0.5 за 10-бальною шкалою, а економія часу склала 400 годин за семестр.

Типи завдань та методи перевірки

Тип завдання Метод перевірки Точність
Тест (вибір відповіді) Детерміноване порівняння 100%
Відкрите питання Семантична схожість + LLM-оцінка ~95%
Есе Рубрика + LLM за критеріями ~90% (узгодженість з викладачем)
Код Юніт-тести + LLM (стиль, ефективність) ~92%
Приклад рубрики для есе з історії
Критерій Відмінно (3) Добре (2) Задовільно (1)
Розуміння контексту Глибоке знання епохи Основні факти вірні Поверхневе знання
Аргументація Чітка позиція з доказами Логічні доводи, але немає посилань Слабка аргументація
Структура Стрункий вступ, тіло, висновок Деякі логічні розриви Хаотичний виклад

Як ми це робимо: стек і кейс

Використовуємо зв'язку: Python + Pydantic для схем, LangChain для оркестрації LLM, Hugging Face Transformers для embeddings. LLM — OpenAI GPT-4o або Claude 3.5 Sonnet (вибір залежить від бюджету та вимог до latency).

Кейс: Для вишу з 5000 студентів ми розгорнули систему на Kubernetes з автоскейлінгом. Середній час перевірки есе — 2 секунди, p99 latency — 3.5 секунди. Узгодженість AI-оцінок з викладацькими — 93% (каппа Коена). За семестр зекономили 400 годин викладацького часу.

Процес роботи

  1. Аналітика: вивчаємо ваші завдання, критерії, поточні проблеми.
  2. Проектування: розробляємо рубрики, обираємо модель, налаштовуємо пайплайн.
  3. Реалізація: пишемо API, інтегруємо з LMS (Moodle, Canvas), додаємо адмінку для викладачів.
  4. Тестування: калібруємо на ваших даних, порівнюємо з ручними оцінками.
  5. Деплой та навчання: розгортаємо на вашій інфраструктурі або нашому хмарі, проводимо вебінар для викладачів.

Що входить до типового проекту

  • Документація: архітектура, API, інструкції для викладачів.
  • Адмінка: управління рубриками, перегляд логів, ручне коригування.
  • Навчання: 2-годинний вебінар + запис.
  • Підтримка: 2 місяці після запуску (Telegram/LMS-чат).
  • Всі артефакти передаються замовнику: код, конфіги, навчені моделі.

Строки та вартість

Строки — від 3 тижнів для типового рішення до 2 місяців при кастомізації під конкретну LMS. Вартість проекту розраховується індивідуально та залежить від обсягу завдань і інтеграції. Оцінимо ваш проект за 1 день — зв'яжіться для консультації.

Ми гарантуємо прозорість: ви завжди бачите, як AI прийшов до оцінки, і можете втрутитися в будь-який момент. Отримайте консультацію інженера: обговоримо ваші завдання та покажемо демо на реальних даних. Замовте пробну перевірку 100 робіт — переконайтеся в якості AI-оцінок. Отримайте попередню оцінку вартості вашого проекту.

Порівняння з ручною перевіркою

Критерій Ручна перевірка AI-система
Час на 100 есе ~40 годин ~5 годин
Узгодженість оцінок ~80% (різні викладачі) ~93% (каппа Коена)
Об'єктивність Залежить від втоми, настрою Анонімізація, калібрування
Детальний зворотний зв'язок Обмежений часом Автоматично за критеріями

AI-система у 8 разів швидше та на 15% точніше за узгодженістю (порівняння з усередненою ручною оцінкою).