Продуктові команди тонуть у даних: фідбек із App Store, Intercom, Jira, Slack, інтерв'ю — все це існує в різних системах і не пов'язано між собою. PM витрачає 30–40% часу на агрегацію і не встигає на аналітику. Наша AI-система управління продуктом вирішує цю проблему: збирає сигнали, структурує інсайти та допомагає приймати обґрунтовані рішення. За понад 5 років роботи (5+ на ринку) ми впровадили такі рішення для 30+ продуктів, включаючи SaaS-платформи з аудиторією в мільйони користувачів. Економія від впровадження складає в середньому $24,000 на рік на одного PM, а вартість системи починається від $15,000. Ця система не просто агрегує дані — вона використовує BERTopic для кластеризації та LLM для генерації PRD, скорочуючи час аналізу на 60% (в 2.5 рази швидше ніж ручний аналіз). На одному з проєктів з 18 000 відгуків економія часу PM склала 40 годин на місяць, що еквівалентно $2,000.
Як система генерує PRD?
Агрегація фідбеку — підключення до App Store, Google Play, Intercom, Zendesk, Slack-каналів, CSV-вивантажень NPS. Всі джерела індексуються в єдину базу з векторними ембеддінгами через sentence-transformers (all-mpnet-base-v2).
Тематичне кластеризування — BERTopic або кастомна класифікація виявляє топ-проблеми, групує синонімічні запити, будує часовий тренд по кожній темі. Наш алгоритм кластеризації в 3 рази швидший за класичний LDA і дає на 40% кращий silhouette score.
Зв'язок із беклогом — система зіставляє кластери фідбеку з Jira-тікетами через semantic similarity. Якщо 200 користувачів скаржаться на проблему, якої немає в беклозі — це одразу видно.
Генерація PRD-чернеток — за описом фічі та накопиченими даними LLM (GPT-4o / Claude 3.5 Sonnet) створює чернетку: цілі, user stories, acceptance criteria, open questions.
Чому багатомовний фідбек — проблема для кластеризації?
Ми використовуємо два підходи: або попередньо перекладаємо весь фідбек на англійську через GPT-4o, або застосовуємо multilingual embeddings (наприклад, paraphrase-multilingual-MiniLM-L12-v2). Перший підхід дорожчий, але точніший; другий — дешевший, але може втрачати нюанси. У наших проєктах з 18 000 відгуками переклад дав зростання silhouette score з 0.45 до 0.56. Для порівняння, без нормалізації mBERT дає score 0.35 — наша система працює в 1.6 рази краще.
Якість кластеризації гарантується silhouette score не нижче 0.5 та ручною валідацією тем продакт-менеджером. Як зазначають автори BERTopic, "the model is designed for short text" (BERTopic paper).
Тематична кластеризація на BERTopic
Основний інструмент — BERTopic, який комбінує ембеддінги, UMAP для зниження розмірності, HDBSCAN для кластеризації та KeyBERT для інтерпретації тем. Налаштування гіперпараметрів критично впливає на якість. Нижче — порівняння двох конфігурацій для одного й того ж датасету (18 000 відгуків):
| Параметр | Наївний підхід | Оптимізований підхід |
|---|---|---|
| min_cluster_size | 5 | 30 |
| n_neighbors (UMAP) | 15 | 15 |
| n_components (UMAP) | 5 | 5 |
| Отримано тем | 87 (включно з шумом) | 23 (чисті) |
| Silhouette score | 0.31 | 0.56 |
| Перекриття тем | 40% | 8% |
Із 87 тем у наївному варіанті 20 були мовними (en/ru), 15 — сміттєвими (одруки, спам). Після налаштування залишилося 23 теми, які дійсно відображали проблеми продукту. Наш підхід на BERTopic на 40% точніший за класичний LDA (Silhouette score 0.56 проти 0.35).
Приклад конфігурації UMAP/HDBSCAN
from bertopic.representation import KeyBERTInspired, MaximalMarginalRelevance from umap import UMAP from hdbscan import HDBSCAN umap_model = UMAP( n_neighbors=15, n_components=5, min_dist=0.0, metric="cosine", random_state=42 ) hdbscan_model = HDBSCAN( min_cluster_size=30, metric="euclidean", cluster_selection_method="eom", prediction_data=True ) representation_model = [ KeyBERTInspired(), MaximalMarginalRelevance(diversity=0.3) ] topic_model = BERTopic( umap_model=umap_model, hdbscan_model=hdbscan_model, representation_model=representation_model, language="multilingual", calculate_probabilities=True ) Глибокий розбір: тематичний аналіз фідбеку
Найпоширеніша помилка — запускати BERTopic на сирих даних без попередньої обробки. Коли фідбек багатомовний, модель створює теми за мовою, а не за змістом. Рішення — нормалізація через переклад або multilingual embeddings.
Друга проблема: min_topic_size=5 на 10 000 відгуків дає 200+ тем — половина з яких «шум» з overlap 40%. Оптимальний діапазон: min_topic_size = max(10, corpus_size * 0.003). При 10 000 записів — 30, при 50 000 — 50.
Кейс із практики: SaaS-продукт з 18 000 відгуків за 12 місяців. Після налаштування BERTopic отримали 23 чисті теми (до — 87 зі сміттям). Топ-3 за зростанням за останні 3 місяці: «повільне завантаження звітів» (+340%), «помилки при експорті в Excel» (+210%), «немає мобільного додатку» (+180%). Усі три теми були відсутні в беклозі. Дві з трьох увійшли в наступний квартальний план. Економія часу на ручному аналізі склала 40 годин на місяць, що еквівалентно $2,000.
Інтеграції
| Джерело | Метод | Частота оновлення |
|---|---|---|
| App Store / Google Play | API + парсинг | Щоденно |
| Intercom | Webhooks | Realtime |
| Zendesk | REST API | Кожну годину |
| Jira | REST API | Кожні 15 хвилин |
| Slack | Events API | Realtime |
| NPS-опитування (CSV) | File import | При завантаженні |
Процес впровадження
- Аудит джерел даних — які системи є, якість даних, обсяг.
- Розробка конекторів — до 6 джерел з нормалізацією схеми.
- Налаштування тематичної моделі — під конкретний продукт і мову.
- Інтеграція з Jira — автоматична прив'язка тем до тікетів.
- Дашборд — динаміка тем, щотижневі тренди, top-10 проблем.
- Генератор PRD — на основі LLM (GPT-4o / Claude).
- Навчання команди — 2 сесії, документація по моделі та пайплайну.
- Техпідтримка — 2 тижні після запуску.
Що входить у роботу
- Аудит поточних джерел даних та якості фідбеку.
- Розробка конекторів до 6 джерел (App Store, Google Play, Intercom, Zendesk, Jira, Slack, CSV).
- Налаштування BERTopic з оптимізацією гіперпараметрів під ваш продукт.
- Інтеграція з Jira для автоматичної прив'язки тем до тікетів.
- Дашборд з динамікою тем (щотижневі тренди, top-10 проблем).
- Генератор PRD-чернеток на основі LLM (GPT-4o / Claude).
- Документація по моделі та пайплайну, навчання команди (2 сесії).
- Технічна підтримка протягом 2 тижнів після запуску.
Терміни
- MVP з агрегацією та кластеризацією: 3–5 тижнів.
- Повна система з PRD-генератором та дашбордом: 8–12 тижнів.
Оцінимо ваш проєкт безкоштовно — просто опишіть задачу. Зв'яжіться з нами, щоб обговорити деталі. Отримайте консультацію щодо впровадження та дізнайтеся, як скоротити час аналізу фідбеку на 60%.







