AI-система для генерації конспектів лекцій

Обробка лекцій з різною якістю звуку

Напрямки AI-розробки

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1443
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1302
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    998
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1267
  • image_logo-advance_0.webp
    Розробка логотипу компанії B2B Advance
    715
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    1006

Обробка лекцій з різною якістю звуку

Головна технічна проблема при автоматичній генерації конспектів лекцій — шум та акценти в аудіодоріжці. Наша AI-система конспектування обробляє відео, аудіо та PDF слайди, використовуючи Whisper large-v3 (OpenAI) з параметром word_timestamps=True. Модель стійка до фонового шуму та діалектів, при необхідності донавчаємо її на корпусі лекцій вишу. Для швидкого чернетки можна взяти модель base, але на академічних текстах large-v3 дає приріст точності на 15–20%.

Модель Точність (WER) Швидкість (на 10 хв лекції) Рекомендація
base ~12% 10–15 сек (CPU/GPU) Швидкий чернетка
large-v3 ~5% 30–60 сек (GPU) Точний конспект
import whisper model = whisper.load_model("large-v3") # "base" для швидкості, "large-v3" для якості result = model.transcribe( "lecture.mp4", language="ru", verbose=False, word_timestamps=True, ) transcript = result["text"] segments = result["segments"] 

Для академічних лекцій з термінологією large-v3 значно точніше. Час обробки на GPU: ~10 хвилин лекції за 30–60 секунд.

Чому ми обираємо Whisper large-v3 для академічних лекцій?

Точність транскрипції безпосередньо впливає на якість конспекту. У тестах на записах лекцій МФТІ та ВШЭ large-v3 показав WER нижче 5%, тоді як базова модель помилялася в кожному десятому слові. Large-v3 точніше базової моделі в 2.4 рази (WER 5% проти 12%). Додатково застосовуємо пост-обробку: видалення стоп-слів, нормалізацію термінів, відновлення пунктуації. Це знижує навантаження на LLM і прискорює генерацію фінального документа. Для підвищення точності на специфічних предметах (медицина, юриспруденція) проводимо fine-tuning моделі на корпусі з 100–500 розмічених лекцій.

Що входить у розробку системи?

Ми проєктуємо пайплайн під ваші дані та інфраструктуру. Стандартний набір етапів:

  1. Аналітика — розбір форматів джерел, вибір оптимального стеку (Whisper, PyTorch, LangChain, Qdrant для векторного пошуку).
  2. Проєктування — розробка схеми обробки: аудіо → транскрипція → LLM-промпт → структурований конспект → експорт.
  3. Реалізація — написання коду, налаштування моделей, інтеграція з LMS (Moodle, Canvas) через REST API.
  4. Тестування — прогін на 50+ реальних лекціях, вимірювання якості конспектів (ROUGE, BLEU).
  5. Деплой — розгортання на вашому GPU-сервері або в хмарі (AWS SageMaker, Vertex AI).
  6. Документація та навчання — інструкції для адміністраторів і студентів.

Як LLM структурує конспект і уникає галюцинацій?

Після транскрипції текст надходить у LLM (ми використовуємо GPT-4 або Claude 3.5) з детальним промптом. Промпт вимагає:

  • Виділити ключові тези (максимум 3 на кожну 10-хвилинну частину).
  • Згрупувати їх у розділи з прикладами та формулами.
  • Згенерувати 3–5 питань для самоперевірки.
  • Не додавати інформацію, відсутню у вихідному тексті.

Для додаткової верифікації впроваджено RAG-шар: LLM перед генерацією розділу знаходить найближчі за змістом фрагменти транскрипту через векторний пошук за ембеддінгами (модель intfloat/multilingual-e5-large). Це знижує ймовірність галюцинацій до статистичної похибки (< 0.5% за тестами).

Терміни та як почати

Типовий проект займає від 2 до 6 тижнів — залежить від кількості джерел (тільки відео або слайди + відео) та глибини кастомізації (fine-tuning, RAG, користувацькі промпти). Вартість розраховується індивідуально.

Зв'яжіться з нами, щоб обговорити ваше завдання. Отримайте демо-доступ до прототипу та консультацію щодо впровадження — ми покажемо, як система впишеться у ваш навчальний процес.

Додаткові функції

  • Таймкоди: кожен розділ конспекту прив'язаний до моменту у відео.
  • Флеш-картки: автоматичне створення карток Anki з ключових термінів.
  • Пов'язані ресурси: згадані джерела як посилання.
  • Тест-питання: генерація питань для самоперевірки.
  • Експорт: Markdown, PDF, Notion-сторінка, інтеграція в LMS через API.

Наші інженери мають 10+ років досвіду в NLP та MLOps. Гарантуємо, що кожен конспект проходить перевірку на галюцинації — LLM не додає інформацію, якої немає у вихідній лекції. Сертифіковані спеціалісти з PyTorch та Hugging Face.

Таблиця порівняння методів транскрипції

Метод Точність (WER) Час обробки Витрати GPU
Whisper base ~12% ~15 сек/10 хв Низькі
Whisper large-v3 ~5% ~45 сек/10 хв Середні
Google Speech-to-Text ~8% ~30 сек/10 хв Високі

Чек-лист для запуску пілотного проекту

  • Зібрати 10–20 репрезентативних лекцій у різних форматах (MP4, MP3, PDF).
  • Визначити цільову LMS та спосіб інтеграції (API, імпорт файлів).
  • Вибрати мову та модель Whisper (base або large-v3).
  • Підготувати промпти для LLM під потрібний стиль конспекту.
  • Протестувати на 3–5 лекціях та скоригувати pipeline.

Офіційна документація Whisper