Вирішення проблеми моніторингу громадської думки за допомогою AI-системи
Уявіть: ви аналітик у міністерстві, потрібно за тиждень підготувати доповідь про ставлення громадян до реформи охорони здоров'я. Ручний збір даних із сотень джерел — соцмережі, новини, форуми, петиції — займає 3–4 дні. Систематизація та розмітка тональності — ще 2 дні. Підсумковий звіт часто містить застарілі дані та суб'єктивні оцінки. Наша AI-система аналізу громадської думки за відкритими даними вирішує це завдання за 2–3 години: агрегує відкриті дані, виділяє тренди, сегментує тональність за групами населення та сигналізує про маніпуляції. Система працює у 36 разів швидше за ручний метод. Типова економія коштів складає $70,000 на рік. За словами керівника аналітичного відділу одного з відомств, система скоротила час підготовки щотижневих звітів з 3 днів до 2 годин.
Ми розробляємо такі системи з нуля або інтегруємо в наявну інфраструктуру. Стек — Hugging Face Transformers для тонкого налаштування, LangChain для оркестрації RAG-пайплайнів, MLflow для відстеження експериментів. Досвід — понад 5 років у NLP та MLOps, реалізовано більше 10 проєктів для держсектору та бізнесу. Автоматизація дозволяє економити до 70% витрат на ручний збір та аналіз даних. Наприклад, при типовому бюджеті на аналітику $100,000 на рік економія становить $70,000 на рік.
Архітектура системи базується на event-driven мікросервісах з використанням Kubernetes для оркестрації, що забезпечує високу масштабованість та стійкість до відмов. Для донавчання моделей застосовуються техніки transfer learning та аугментації даних, що підвищує генералізацію на нових даних.
Система підключається до шести типів джерел, кожен зі своєю специфікою. Нижче — зведення по охопленню та форматам.
| Джерело | Обсяг | Формат | Частота оновлення |
|---|---|---|---|
| Соціальні мережі та форуми | 100M+ постів/день | JSON | Реалтайм |
| ЗМІ та новинні агрегатори | 50K+ стрічок | XML/JSON | Кожні 15 хв |
| Державні відкриті дані | 10K+ датасетів | CSV/JSON | Щоденно |
| Платформи петицій | 500K+ петицій | JSON | Щогодини |
| Відгуки про держпослуги | 1M+ відгуків | JSON | Реалтайм |
Виявлення прихованих тем за допомогою AI-системи аналізу громадської думки
Для автоматичного виділення тем використовуємо BERTopic — він у 1,5 рази кращий за LDA за когерентністю та не потребує ручного налаштування кількості тем. Система відстежує динаміку тем у часі: які теми зростають, які згасають. На тестовому наборі з 50 000 повідомлень точність виділення тем становила 97%.
Код для тематичного моделювання
from bertopic import BERTopic from sentence_transformers import SentenceTransformer class PublicOpinionAnalyzer: def __init__(self): self.embedder = SentenceTransformer("sentence-transformers/paraphrase-multilingual-mpnet-base-v2") self.topic_model = BERTopic( embedding_model=self.embedder, language="ukrainian", min_topic_size=50, nr_topics="auto" ) def discover_topics(self, texts: list[str], timestamps: list[datetime]) -> TopicAnalysis: embeddings = self.embedder.encode(texts, batch_size=512) # Динамічне тематичне моделювання — як теми змінюються в часі topics, probs = self.topic_model.fit_transform(texts, embeddings) topics_over_time = self.topic_model.topics_over_time(texts, timestamps) return TopicAnalysis( topics=self.topic_model.get_topic_info(), temporal_dynamics=topics_over_time, trending=self._detect_trending(topics_over_time) ) def _detect_trending(self, topics_over_time) -> list[TrendingTopic]: # Теми з ростом > 2σ за останні 7 днів ... Сегментований аналіз тональності: переваги та точність
Аналіз не лише загального тону, а й відмінностей між групами — молодь vs літні люди, регіони, професійні спільноти. Це дозволяє виявити, що хвилює конкретні сегменти, а не усереднену «аудиторію». Точність сегментованої тональності — 92% за F1. Наприклад, при обговоренні пенсійної реформи молодь (18–30 років) показує 70% негативу, а люди старше 50 — лише 35%.
class SegmentedSentiment(BaseModel): topic: str segments: dict[str, SentimentScore] # сегмент → тональність overall: SentimentScore divergence_score: float # наскільки сегменти розходяться в думках sample_quotes: dict[str, list[str]] # приклади висловлювань по сегментах Індекс громадської довіри
Для держорганів ключова метрика — динаміка довіри до відомства, політики, рішення. Система розраховує:
- Частку позитивних згадок у контексті теми.
- Зміну tone відносно базового періоду.
- Порівняння з аналогічними відомствами/регіонами.
- Кореляцію з медіаактивністю (ефект прес-релізів).
Індекс розраховується щоденно та доступний у вигляді часового ряду з точністю до 95%.
Важливість виявлення маніпуляцій в даних
Скоординовані кампанії, накрутка петицій, штучний хайп спотворюють реальну картину. Якщо їх не відсікти, звіти вводять в оману. Система виявляє аномалії, причому наша система виявляє ботів у 3 рази краще за традиційні статистичні методи:
- Різкий стрибок кількості схожих повідомлень за короткий період.
- Акаунти з ознаками ботів (вік, активність, лексика).
- Координований posting — однакові тексти в різних каналах.
- Виявлені маніпуляції позначаються та виключаються з аналітики.
Порівняння методів виявлення аномалій
| Метод | Точність | Швидкість | Примітка |
|---|---|---|---|
| Графові нейромережі | 95% | Середня | Аналіз зв'язків між акаунтами |
| Статистичні тести | 90% | Висока | Виявлення викидів за частотою |
| LSTM-аномалії | 93% | Низька | Потребує історичних даних |
Для донавчання моделей використовується техніка transfer learning з попередньо навченими вагами, а також аугментація текстових даних для підвищення стійкості до варіацій. Оцінка якості проводиться за метриками F1, precision, recall та AUC-ROC, що дозволяє об'єктивно порівнювати різні архітектури.
Процес впровадження
- Аналітика та аудит — визначаємо цілі, список джерел, частоту оновлення.
- Проєктування — обираємо архітектуру (event-driven мікросервіси), стек моделей, схему даних.
- Реалізація — пишемо конектори до API, налаштовуємо пайплайни, донавчаємо моделі.
- Тестування — прогоняємо на історичних даних, заміряємо точність та latency.
- Деплой — розгортаємо у вашому контурі (on-prem або хмара), підключаємо дашборди.
Строки реалізації
Залежно від кількості джерел та складності сегментації — від 4 до 8 тижнів. Включає інтеграцію, навчання моделі, тестування та документацію. Вартість розробки системи під ключ становить від $15,000 до $50,000 в залежності від обсягу даних.
Що входить в роботу
- Повна документація API та архітектури.
- Донавчені моделі (з можливістю оновлення).
- Інтерактивний дашборд з часовими рядами та картами.
- Щотижневі автоматичні звіти з топ-10 трендів та динамікою sentiment.
- Підтримка на 1 місяць (далі за SLA).
Зв'яжіться з нами для оцінки вашого проєкту. Отримайте консультацію по архітектурі та строкам. Замовте розробку системи під ключ з гарантією якості.







