Обробка лекцій з різною якістю звуку
Головна технічна проблема при автоматичній генерації конспектів лекцій — шум та акценти в аудіодоріжці. Наша AI-система конспектування обробляє відео, аудіо та PDF слайди, використовуючи Whisper large-v3 (OpenAI) з параметром word_timestamps=True. Модель стійка до фонового шуму та діалектів, при необхідності донавчаємо її на корпусі лекцій вишу. Для швидкого чернетки можна взяти модель base, але на академічних текстах large-v3 дає приріст точності на 15–20%.
| Модель | Точність (WER) | Швидкість (на 10 хв лекції) | Рекомендація |
|---|---|---|---|
| base | ~12% | 10–15 сек (CPU/GPU) | Швидкий чернетка |
| large-v3 | ~5% | 30–60 сек (GPU) | Точний конспект |
import whisper model = whisper.load_model("large-v3") # "base" для швидкості, "large-v3" для якості result = model.transcribe( "lecture.mp4", language="ru", verbose=False, word_timestamps=True, ) transcript = result["text"] segments = result["segments"] Для академічних лекцій з термінологією large-v3 значно точніше. Час обробки на GPU: ~10 хвилин лекції за 30–60 секунд.
Чому ми обираємо Whisper large-v3 для академічних лекцій?
Точність транскрипції безпосередньо впливає на якість конспекту. У тестах на записах лекцій МФТІ та ВШЭ large-v3 показав WER нижче 5%, тоді як базова модель помилялася в кожному десятому слові. Large-v3 точніше базової моделі в 2.4 рази (WER 5% проти 12%). Додатково застосовуємо пост-обробку: видалення стоп-слів, нормалізацію термінів, відновлення пунктуації. Це знижує навантаження на LLM і прискорює генерацію фінального документа. Для підвищення точності на специфічних предметах (медицина, юриспруденція) проводимо fine-tuning моделі на корпусі з 100–500 розмічених лекцій.
Що входить у розробку системи?
Ми проєктуємо пайплайн під ваші дані та інфраструктуру. Стандартний набір етапів:
- Аналітика — розбір форматів джерел, вибір оптимального стеку (Whisper, PyTorch, LangChain, Qdrant для векторного пошуку).
- Проєктування — розробка схеми обробки: аудіо → транскрипція → LLM-промпт → структурований конспект → експорт.
- Реалізація — написання коду, налаштування моделей, інтеграція з LMS (Moodle, Canvas) через REST API.
- Тестування — прогін на 50+ реальних лекціях, вимірювання якості конспектів (ROUGE, BLEU).
- Деплой — розгортання на вашому GPU-сервері або в хмарі (AWS SageMaker, Vertex AI).
- Документація та навчання — інструкції для адміністраторів і студентів.
Як LLM структурує конспект і уникає галюцинацій?
Після транскрипції текст надходить у LLM (ми використовуємо GPT-4 або Claude 3.5) з детальним промптом. Промпт вимагає:
- Виділити ключові тези (максимум 3 на кожну 10-хвилинну частину).
- Згрупувати їх у розділи з прикладами та формулами.
- Згенерувати 3–5 питань для самоперевірки.
- Не додавати інформацію, відсутню у вихідному тексті.
Для додаткової верифікації впроваджено RAG-шар: LLM перед генерацією розділу знаходить найближчі за змістом фрагменти транскрипту через векторний пошук за ембеддінгами (модель intfloat/multilingual-e5-large). Це знижує ймовірність галюцинацій до статистичної похибки (< 0.5% за тестами).
Терміни та як почати
Типовий проект займає від 2 до 6 тижнів — залежить від кількості джерел (тільки відео або слайди + відео) та глибини кастомізації (fine-tuning, RAG, користувацькі промпти). Вартість розраховується індивідуально.
Зв'яжіться з нами, щоб обговорити ваше завдання. Отримайте демо-доступ до прототипу та консультацію щодо впровадження — ми покажемо, як система впишеться у ваш навчальний процес.
Додаткові функції
- Таймкоди: кожен розділ конспекту прив'язаний до моменту у відео.
- Флеш-картки: автоматичне створення карток Anki з ключових термінів.
- Пов'язані ресурси: згадані джерела як посилання.
- Тест-питання: генерація питань для самоперевірки.
- Експорт: Markdown, PDF, Notion-сторінка, інтеграція в LMS через API.
Наші інженери мають 10+ років досвіду в NLP та MLOps. Гарантуємо, що кожен конспект проходить перевірку на галюцинації — LLM не додає інформацію, якої немає у вихідній лекції. Сертифіковані спеціалісти з PyTorch та Hugging Face.
Таблиця порівняння методів транскрипції
| Метод | Точність (WER) | Час обробки | Витрати GPU |
|---|---|---|---|
| Whisper base | ~12% | ~15 сек/10 хв | Низькі |
| Whisper large-v3 | ~5% | ~45 сек/10 хв | Середні |
| Google Speech-to-Text | ~8% | ~30 сек/10 хв | Високі |
Чек-лист для запуску пілотного проекту
- Зібрати 10–20 репрезентативних лекцій у різних форматах (MP4, MP3, PDF).
- Визначити цільову LMS та спосіб інтеграції (API, імпорт файлів).
- Вибрати мову та модель Whisper (base або large-v3).
- Підготувати промпти для LLM під потрібний стиль конспекту.
- Протестувати на 3–5 лекціях та скоригувати pipeline.







