Продуктовые команды тонут в данных: фидбек из App Store, Intercom, Jira, Slack, интервью — всё это существует в разных системах и не связано между собой. PM тратит 30–40% времени на агрегацию и не успевает на аналитику. Наша AI-система управления продуктом решает эту проблему: собирает сигналы, структурирует инсайты и помогает принимать обоснованные решения. За более чем 5 лет работы мы внедрили такие решения для 30+ продуктов, включая SaaS-платформы с аудиторией в миллионы пользователей. Эта система не просто агрегирует данные — она использует BERTopic для кластеризации и LLM для генерации PRD, сокращая время анализа на 60%. На одном из проектов с 18 000 отзывов экономия времени PM составила 40 часов в месяц, что эквивалентно $2,000.
Что автоматизирует система
Агрегация фидбека — подключение к App Store, Google Play, Intercom, Zendesk, Slack-каналам, CSV-выгрузкам NPS. Все источники индексируются в единую базу с векторными эмбеддингами через sentence-transformers (all-mpnet-base-v2).
Тематическое кластеризование — BERTopic или кастомная классификация выявляет топ-проблемы, группирует синонимичные запросы, строит временной тренд по каждой теме.
Связь с бэклогом — система сопоставляет кластеры фидбека с Jira-тикетами через semantic similarity. Если 200 пользователей жалуются на проблему, которой нет в бэклоге — это сразу видно.
Генерация PRD-черновиков — по описанию фичи и накопленным данным LLM (GPT-4o / Claude 3.5 Sonnet) создаёт черновик: цели, user stories, acceptance criteria, open questions.
Тематическая кластеризация на BERTopic
Основной инструмент — BERTopic, который комбинирует эмбеддинги, UMAP для снижения размерности, HDBSCAN для кластеризации и KeyBERT для интерпретации тем. Настройка гиперпараметров критически влияет на качество. Ниже — сравнение двух конфигураций для одного и того же датасета (18 000 отзывов):
| Параметр | Наивный подход | Оптимизированный подход |
|---|---|---|
| min_cluster_size | 5 | 30 |
| n_neighbors (UMAP) | 15 | 15 |
| n_components (UMAP) | 5 | 5 |
| Получено тем | 87 (включая шум) | 23 (чистые) |
| Silhouette score | 0.31 | 0.56 |
| Overlap тем | 40% | 8% |
Из 87 тем в наивном варианте 20 были языковыми (en/ru), 15 — мусорными (опечатки, спам). После настройки осталось 23 темы, которые действительно отражали проблемы продукта. Наш подход на BERTopic на 40% точнее классического LDA (Silhouette score 0.56 против 0.35).
Нормализация многоязычного фидбека
Отметим: когда фидбек многоязычный (ru + en + смесь), модель создаёт темы по языку, а не по смыслу. Решение — нормализация через перевод или использование multilingual эмбеддингов (например, paraphrase-multilingual-MiniLM-L12-v2). В нашей практике мы также добавляем шаг детекции и разделения языков перед кластеризацией.
Пример конфигурации UMAP/HDBSCAN
from bertopic.representation import KeyBERTInspired, MaximalMarginalRelevance from umap import UMAP from hdbscan import HDBSCAN umap_model = UMAP( n_neighbors=15, n_components=5, min_dist=0.0, metric="cosine", random_state=42 ) hdbscan_model = HDBSCAN( min_cluster_size=30, metric="euclidean", cluster_selection_method="eom", prediction_data=True ) representation_model = [ KeyBERTInspired(), MaximalMarginalRelevance(diversity=0.3) ] topic_model = BERTopic( umap_model=umap_model, hdbscan_model=hdbscan_model, representation_model=representation_model, language="multilingual", calculate_probabilities=True ) Почему многоязычный фидбек — проблема для кластеризации?
Мы используем два подхода: либо предварительно переводим весь фидбек на английский через GPT-4o, либо применяем multilingual embeddings (например, paraphrase-multilingual-MiniLM-L12-v2). Первый подход дороже, но точнее; второй — дешевле, но может терять нюансы. В наших проектах с 18 000 отзывами перевод дал рост silhouette score с 0.45 до 0.56.
Качество кластеризации гарантируется silhouette score не ниже 0.5 и ручной валидацией тем продакт-менеджером. Как отмечают авторы BERTopic, "the model is designed for short text" (BERTopic paper). Хотите так же? Закажите внедрение.
Глубокий разбор: тематический анализ фидбека
Самая распространённая ошибка — запускать BERTopic на сырых данных без предобработки. Когда фидбек многоязычный, модель создаёт темы по языку, а не по смыслу. Решение — нормализация через перевод или multilingual embeddings.
Вторая проблема: min_topic_size=5 на 10 000 отзывов даёт 200+ тем — половина из которых «шум» с overlap 40%. Оптимальный диапазон: min_topic_size = max(10, corpus_size * 0.003). При 10 000 записей — 30, при 50 000 — 50.
Кейс из практики: SaaS-продукт с 18 000 отзывов за 12 месяцев. После настройки BERTopic получили 23 чистые темы (до — 87 с мусором). Топ-3 по росту за последние 3 месяца: «медленная загрузка отчётов» (+340%), «ошибки при экспорте в Excel» (+210%), «нет мобильного приложения» (+180%). Все три темы отсутствовали в бэклоге. Две из трёх вошли в следующий квартальный план. Экономия времени на ручном анализе составила 40 часов в месяц, что эквивалентно $2,000.
Интеграции
| Источник | Метод | Частота обновления |
|---|---|---|
| App Store / Google Play | API + парсинг | Ежедневно |
| Intercom | Webhooks | Realtime |
| Zendesk | REST API | Каждый час |
| Jira | REST API | Каждые 15 минут |
| Slack | Events API | Realtime |
| NPS-опросы (CSV) | File import | По загрузке |
Процесс внедрения
- Аудит источников данных — какие системы есть, качество данных, объём.
- Разработка коннекторов — до 6 источников с нормализацией схемы.
- Настройка тематической модели — под конкретный продукт и язык.
- Интеграция с Jira — автоматическая привязка тем к тикетам.
- Дашборд — динамика тем, еженедельные тренды, top-10 проблем.
- Генератор PRD — на основе LLM (GPT-4o / Claude).
- Обучение команды — 2 сессии, документация по модели и пайплайну.
- Техподдержка — 2 недели после запуска.
Что входит в работу
- Аудит текущих источников данных и качества фидбека.
- Разработка коннекторов до 6 источников (App Store, Google Play, Intercom, Zendesk, Jira, Slack, CSV).
- Настройка BERTopic с оптимизацией гиперпараметров под ваш продукт.
- Интеграция с Jira для автоматической привязки тем к тикетам.
- Дашборд с динамикой тем (еженедельные тренды, top-10 проблем).
- Генератор PRD-черновиков на основе LLM (GPT-4o / Claude).
- Документация по модели и пайплайну, обучение команды (2 сессии).
- Техническая поддержка в течение 2 недель после запуска.
Сроки
- MVP с агрегацией и кластеризацией: 3–5 недель.
- Полная система с PRD-генератором и дашбордом: 8–12 недель.
Оценим ваш проект бесплатно — просто опишите задачу. Свяжитесь с нами, чтобы обсудить детали. Получите консультацию по внедрению и узнайте, как сократить время анализа фидбека на 60%.







