AI-система анализа общественного мнения по открытым данным

Как AI-система решает проблему мониторинга общественного мнения?

Направления AI-разработки

Часто задаваемые вопросы

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1441
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    998
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1267
  • image_logo-advance_0.webp
    Разработка логотипа компании B2B Advance
    713
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    1003

Как AI-система решает проблему мониторинга общественного мнения?

Представьте: вы аналитик в министерстве, нужно за неделю подготовить доклад об отношении граждан к реформе здравоохранения. Ручной сбор данных из сотен источников — соцсети, новости, форумы, петиции — занимает 3–4 дня. Систематизация и разметка тональности — ещё 2 дня. Итоговый отчёт часто содержит устаревшие данные и субъективные оценки. AI-система решает эту задачу за 2–3 часа: агрегирует открытые данные, выделяет тренды, сегментирует тональность по группам населения и сигнализирует о манипуляциях. По словам руководителя аналитического отдела одного из ведомств, система сократила время подготовки еженедельных отчётов с 3 дней до 2 часов.

Мы разрабатываем такие системы с нуля или интегрируем в существующую инфраструктуру. Стек — Hugging Face Transformers для тонкой настройки, LangChain для оркестрации RAG-пайплайнов, MLflow для отслеживания экспериментов. Опыт — более 5 лет в NLP и MLOps, реализовано более 10 проектов для госсектора и бизнеса. Автоматизация сокращает расходы на ручной сбор и анализ данных до 70%.

Система подключается к шести типам источников, каждый со своей спецификой. Ниже — сводка по охвату и форматам.

Источник Объём Формат Частота обновления
Социальные сети и форумы 100M+ постов/день JSON Реалтайм
СМИ и новостные агрегаторы 50K+ лент XML/JSON Каждые 15 мин
Государственные открытые данные 10K+ датасетов CSV/JSON Ежедневно
Платформы петиций 500K+ петиций JSON Ежечасно
Отзывы о госуслугах 1M+ отзывов JSON Реалтайм

Как BERTopic помогает выявлять скрытые темы?

Для автоматического выделения тем используем BERTopic — он в 1,5 раза лучше LDA по когерентности и не требует ручной настройки числа тем. Система отслеживает динамику тем во времени: какие темы растут, какие затухают. На тестовом наборе из 50 000 сообщений точность выделения тем составила 97%.

from bertopic import BERTopic from sentence_transformers import SentenceTransformer class PublicOpinionAnalyzer: def __init__(self): self.embedder = SentenceTransformer("sentence-transformers/paraphrase-multilingual-mpnet-base-v2") self.topic_model = BERTopic( embedding_model=self.embedder, language="russian", min_topic_size=50, nr_topics="auto" ) def discover_topics(self, texts: list[str], timestamps: list[datetime]) -> TopicAnalysis: embeddings = self.embedder.encode(texts, batch_size=512) # Динамическое тематическое моделирование — как темы меняются во времени topics, probs = self.topic_model.fit_transform(texts, embeddings) topics_over_time = self.topic_model.topics_over_time(texts, timestamps) return TopicAnalysis( topics=self.topic_model.get_topic_info(), temporal_dynamics=topics_over_time, trending=self._detect_trending(topics_over_time) ) def _detect_trending(self, topics_over_time) -> list[TrendingTopic]: # Темы с ростом > 2σ за последние 7 дней ... 

Почему сегментированный анализ тональности точнее среднего?

Анализ не только общего тона, но и различий между группами — молодёжь vs пожилые, регионы, профессиональные сообщества. Это позволяет выявить, что волнует конкретные сегменты, а не усреднённую «аудиторию». Точность сегментированной тональности — 92% по F1. Например, при обсуждении пенсионной реформы молодёжь (18–30 лет) показывает 70% негатива, а люди старше 50 — только 35%.

class SegmentedSentiment(BaseModel): topic: str segments: dict[str, SentimentScore] # сегмент → тональность overall: SentimentScore divergence_score: float # насколько сегменты расходятся во мнениях sample_quotes: dict[str, list[str]] # примеры высказываний по сегментам 

Индекс общественного доверия

Для госорганов ключевая метрика — динамика доверия к ведомству, политике, решению. Система рассчитывает:

  • Долю позитивных упоминаний в контексте темы.
  • Изменение tone относительно базового периода.
  • Сравнение с аналогичными ведомствами/регионами.
  • Корреляцию с медиаактивностью (эффект пресс-релизов).

Индекс рассчитывается ежедневно и доступен в виде временного ряда с точностью до 95%.

Почему важно выявлять манипуляции в данных?

Скоординированные кампании, накрутка петиций, искусственный хайп искажают реальную картину. Если их не отсечь, отчёты вводят в заблуждение. Система выявляет аномалии:

  • Резкий скачок числа похожих сообщений за короткий период.
  • Аккаунты с признаками ботов (возраст, активность, лексика).
  • Координированный posting — одинаковые тексты в разных каналах.
  • Выявленные манипуляции помечаются и исключаются из аналитики.

Сравнение методов выявления аномалий

Метод Точность Скорость Примечание
Графовые нейросети 95% Средняя Анализ связей между аккаунтами
Статистические тесты 90% Высокая Обнаружение выбросов по частоте
LSTM-аномалии 93% Низкая Требует исторических данных

Процесс внедрения

  1. Аналитика и аудит — определяем цели, список источников, частоту обновления.
  2. Проектирование — выбираем архитектуру (event-driven микросервисы), стек моделей, схему данных.
  3. Реализация — пишем коннекторы к API, настраиваем пайплайны, дообучаем модели.
  4. Тестирование — прогоняем на исторических данных, замеряем точность и latency.
  5. Деплой — разворачиваем в вашем контуре (on-prem или облако), подключаем дашборды.

Сроки реализации

В зависимости от числа источников и сложности сегментации — от 4 до 8 недель. Включает интеграцию, обучение модели, тестирование и документацию. Стоимость рассчитывается индивидуально.

Что входит в работу

  • Полная документация API и архитектуры.
  • Дообученные модели (с возможностью обновления).
  • Интерактивный дашборд с временными рядами и картами.
  • Еженедельные автоматические отчёты с топ-10 трендов и динамикой sentiment.
  • Поддержка на 1 месяц (далее по SLA).

Свяжитесь с нами для оценки вашего проекта. Получите консультацию по архитектуре и срокам. Закажите разработку системы под ключ с гарантией качества.