Мониторинг бэкенда мобильного приложения: Prometheus + Grafana под ключ

TRUETECH занимается разработкой, поддержкой и обслуживанием мобильных приложений iOS, Android, PWA. Имеем большой опыт и экспертизу для публикации мобильных приложений в популярные маркеты Google Play, App Store, Amazon, AppGallery и другие.

Разработка и поддержка любых видов мобильных приложений:

Информационные и развлекательные мобильные приложения
Новостные приложения, игры, справочники, онлайн-каталоги, погодные, фитнес и здоровье, туристические, образовательные, социальные сети и мессенджеры, квиз, блоги и подкасты, форумы, агрегаторы
Мобильные приложения электронной коммерции
Интернет-магазины, B2B-приложения, маркетплейсы, онлайн-обменники, кэшбэк-сервисы, биржи, дропшиппинг-платформы, программы лояльности, доставка еды и товаров, платежные системы
Мобильные приложения для управления бизнес-процессами
CRM-системы, ERP-системы, управление проектами, инструменты для команды продаж, учет финансов, управление производством, логистика и доставка, управление персоналом, системы мониторинга данных
Мобильные приложения электронных услуг
Доски объявлений, онлайн-школы, онлайн-кинотеатры, платформы предоставления электронных услуг, платформы кешбека, видеохостинги, тематические порталы, платформы онлайн-бронирования и записи, платформы онлайн-торговли

Это лишь некоторые из типы мобильных приложений, с которыми мы работаем, и каждый из них может иметь свои специфические особенности и функциональность, а также быть адаптированным под конкретные потребности и цели клиента.

Услуги, которые мы предлагаем
Показано 1 из 1Все 1734 услуг
Мониторинг бэкенда мобильного приложения: Prometheus + Grafana под ключ
Средний
~2-3 дня
Часто задаваемые вопросы

Наши компетенции:

Этапы разработки

Последние работы

  • image_mobile-applications_feedme_467_0.webp
    Разработка мобильного приложения для компании FEEDME
    860
  • image_mobile-applications_xoomer_471_0.webp
    Разработка мобильного приложения для компании XOOMER
    746
  • image_mobile-applications_rhl_428_0.webp
    Разработка мобильного приложения для компании RHL
    1163
  • image_mobile-applications_zippy_411_0.webp
    Разработка мобильного приложения для компании ZIPPY
    1035
  • image_mobile-applications_affhome_429_0.webp
    Разработка мобильного приложения для компании Affhome
    970
  • image_mobile-applications_flavors_409_0.webp
    Разработка мобильного приложения для компании FLAVORS
    564

Представьте: ваше мобильное приложение внезапно начинает тормозить, а Crashlytics молчит. Пользователи уходят, а вы не видите причины. Это типичная ситуация, когда проблема на бэкенде — и без мониторинга её не найти. Мы настраиваем полный стек мониторинга бэкенда мобильных приложений на базе Prometheus и Grafana, чтобы вы видели каждый сбой и деградацию до того, как они повлияют на пользователей.

За 5+ лет работы мы провели более 50 внедрений для iOS и Android проектов — от стартапов до enterprise. Гарантируем, что через 2 дня после старта вы получите работающий дашборд с ключевыми метриками. Инвестиция в мониторинг окупается за 1-2 месяца: средний SLA-штраф при простое может достигать 5000 у.е. в час, а мониторинг позволяет сократить время обнаружения инцидентов на 80%.

Почему именно Prometheus?

Согласно документации Prometheus, pull-модель сбора метрик упрощает обнаружение новых целей через service discovery и снижает нагрузку на сеть. Prometheus масштабируется до 10^6 метрик на одном инстансе, в то время как Zabbix начинает тормозить при 10^5. Многомерная модель данных с лейблами позволяет гибко фильтровать и агрегировать — например, посмотреть latency только для endpoints с методом POST.

Какие метрики критичны для бэкенда мобильного приложения?

Для бэкенда мобильного приложения критичны четыре группы метрик:

Тип метрики Примеры Почему важны
API-метрики latency, error rate, throughput p95 и p99 latency напрямую влияют на UX. Среднее значение скрывает хвостовые задержки.
Метрики БД active connections, query duration, lock waits Медленные запросы — частая причина деградации. pg_stat_statements помогает найти их.
Метрики инфраструктуры CPU, RAM, disk I/O Узкие места на серверах приводят к падениям.
Метрики очередей глубина очереди, lag consumer Фоновая обработка должна успевать.

Дополнительно рекомендуем мониторить SSL-сертификаты: срок действия истекает — пользователи не могут подключиться. Для этого используем blackbox_exporter.

Как инструментировать API-сервер?

Prometheus ожидает метрики в своём формате. Для разных языков — готовые клиентские библиотеки:

# Python (FastAPI / Flask)
from prometheus_fastapi_instrumentator import Instrumentator

app = FastAPI()
Instrumentator().instrument(app).expose(app)
# Endpoint /metrics появляется автоматически
// Go (Echo / Gin)
import "github.com/prometheus/client_golang/prometheus/promhttp"

func setupMetrics(e *echo.Echo) {
    httpRequestsTotal := prometheus.NewCounterVec(
        prometheus.CounterOpts{Name: "http_requests_total"},
        []string{"method", "path", "status"},
    )
    prometheus.MustRegister(httpRequestsTotal)

    e.Use(func(next echo.HandlerFunc) echo.HandlerFunc {
        return func(c echo.Context) error {
            err := next(c)
            httpRequestsTotal.WithLabelValues(
                c.Request().Method, c.Path(),
                strconv.Itoa(c.Response().Status),
            ).Inc()
            return err
        }
    })
    e.GET("/metrics", echo.WrapHandler(promhttp.Handler()))
}

Важно: не создавать метрику с path как high-cardinality label — если в path есть user_id или другие динамические значения, Prometheus захлебнётся. Нормализуй путь: /users/12345/profile/users/:id/profile. Также настраиваем кастомные метрики для бизнес-логики: количество заказов, ошибки аутентификации, время ответа внешних API.

Какая конфигурация Prometheus подходит для production?

Базовый prometheus.yml для мобильного бэкенда:

global:
  scrape_interval: 15s
  evaluation_interval: 15s

scrape_configs:
  - job_name: 'api-server'
    static_configs:
      - targets: ['api:8080']
    metrics_path: /metrics

  - job_name: 'postgres'
    static_configs:
      - targets: ['postgres-exporter:9187']

  - job_name: 'redis'
    static_configs:
      - targets: ['redis-exporter:9121']

  - job_name: 'node'
    static_configs:
      - targets: ['node-exporter:9100']

Для production — Service Discovery через Consul или Kubernetes service discovery вместо static_configs. Также добавляем scrape_timeout по 10s, чтобы не ждать висящие эндпоинты.

Как мы это делаем: кейс из практики

Один наш клиент с мобильным приложением для доставки столкнулся с ростом p99 latency до 12 секунд. После внедрения мониторинга обнаружили узкое место в запросе к PostgreSQL — отсутствовал индекс. Оптимизация заняла 2 часа, а latency упала до 200ms (улучшение в 60 раз). Без мониторинга эта проблема могла оставаться незамеченной неделями, а потери от ушедших пользователей составили бы десятки тысяч у.е.

Какие дашборды строим в Grafana?

Не нужно строить дашборды с нуля — Grafana.com/dashboards содержит готовые: ID 1860 для Node Exporter, ID 9628 для PostgreSQL через postgres_exporter. Импортируются одним кликом.

Для API-мониторинга строим кастомный дашборд с ключевыми панелями:

  • rate(http_requests_total[5m]) — RPS по endpoint
  • histogram_quantile(0.95, rate(http_request_duration_seconds_bucket[5m])) — p95 latency
  • rate(http_requests_total{status=~"5.."}[5m]) / rate(http_requests_total[5m]) — error rate
Панель Метрика Источник Важность
RPS rate(http_requests_total[5m]) API Высокая — показывает нагрузку
p95 latency histogram_quantile(0.95, ...) API Критическая — влияет на UX
Error rate ... / rate(...) API Высокая
Active connections pg_stat_activity_count postgres_exporter Средняя
Queue lag redis_queue_length redis_exporter Средняя

Как настроить алертинг?

Grafana Alerting или Alertmanager — настраиваем пороги для PagerDuty/Telegram/Slack. Минимальный набор алертов для мобильного бэкенда:

# alerting/rules.yml
groups:
  - name: api
    rules:
      - alert: HighErrorRate
        expr: rate(http_requests_total{status=~"5.."}[5m]) / rate(http_requests_total[5m]) > 0.05
        for: 2m
        labels:
          severity: critical
        annotations:
          summary: "Error rate > 5% on {{ $labels.job }}"

      - alert: HighLatency
        expr: histogram_quantile(0.95, rate(http_request_duration_seconds_bucket[5m])) > 1
        for: 5m
        annotations:
          summary: "p95 latency > 1s"

for: 2m — не поднимать алерт при кратковременных всплесках, только при устойчивой деградации. Пошаговая инструкция:

  1. Установить Alertmanager и настроить receivers (Telegram, Slack).
  2. Создать файл rules.yml с описанными правилами.
  3. Добавить файл в prometheus.yml секцию rule_files.
  4. Проверить правила через promtool check rules rules.yml.
  5. Настроить маршрутизацию: critical алерты — в Telegram/PagerDuty, warning — в Slack.

Типичные ошибки при настройке мониторинга

  • Высокая кардинальность лейблов — не включайте в path user_id или session_id.
  • Отсутствие порогов для алертов — без них вы узнаете о проблеме только от пользователей.
  • Игнорирование p99 latency — среднее значение скрывает единичные замедления.
  • Неправильный scrape_interval — слишком редкий сбор пропустит кратковременные всплески.

Что входит в нашу работу

  • Docker Compose или Kubernetes манифесты для Prometheus, Grafana, Alertmanager
  • Инструментирование API-сервера (Python / Go / Node.js / Java)
  • Подключение экспортёров: postgres_exporter, redis_exporter, node_exporter
  • Кастомные дашборды в Grafana под специфику приложения
  • Настройка алертов с маршрутизацией в Telegram / Slack / PagerDuty
  • Документация по метрикам и порогам алертов

Сроки и стоимость

Базовая установка с готовыми дашбордами и алертами: 2–3 дня. Полный стек с кастомными метриками, инструментированием кода и production-ready конфигурацией: 4–6 дней. Стоимость рассчитывается индивидуально. Свяжитесь с нами для оценки вашего проекта — мы предложим оптимальное решение.

Закажите настройку мониторинга — оценим ваш проект за 1 день. Получите консультацию по выбору метрик и порогов алертов.

Аналитика мобильных приложений: Firebase, Amplitude, AppsFlyer и атрибуция

Наша команда регулярно сталкивается с проектами, где аналитика уже «настроена», но реальных инсайтов нет. Типичный пример — стартап с 50k DAU: трекинг десятков событий без единого ответа на вопрос «почему пользователи не доходят до оплаты». За две недели мы построили базовую воронку и выяснили, что 70% аудитории отваливается на экране верификации номера телефона. После локализации бага retention вырос на 12%. Вывод: аналитика должна начинаться с конкретных вопросов, а не с трекинга всего подряд.

Почему таксономия событий — основа аналитики мобильных приложений?

Firebase Analytics, Amplitude, Mixpanel — технически похожи. Разница в том, что вы в них кладёте. Типичная ошибка: события screen_view, button_tap_1, button_tap_2 без контекста. Через месяц никто не помнит, что такое button_tap_2.

Правильная таксономия: объект + действие + контекст. product_viewed, checkout_started, payment_completed с параметрами product_id, category, price, source. Это позволяет строить воронки, когортный анализ и retention без дополнительного трекинга.

Мы фиксируем naming convention в tracking plan — документе (Google Sheet или Amplitude Data Catalog), где описано каждое событие, его параметры и условия срабатывания. Tracking plan синхронизируется с командой аналитиков до начала разработки, а не после. Такой подход гарантирует, что через месяц данные останутся интерпретируемыми, а не превратятся в свалку. Опыт внедрения на 50+ проектах подтверждает: при отсутствии tracking plan стоимость поддержки аналитики вырастает в 2-3 раза за счёт переделок.

Что выбрать для аналитики мобильных приложений: Firebase, Amplitude или Mixpanel?

Таблица ниже показывает ключевые различия трёх популярных платформ. Выбор зависит от бюджета, трафика и задач.

Критерий Firebase Analytics Amplitude Mixpanel
Бесплатный лимит Безлимит (в рамках Spark-плана) До 10 млн events/мес До 1 тыс. MTU/мес (Special)
Задержка данных До 24 часов (стандарт) Минуты (real-time) Минуты (real-time)
Воронки и когорты Базовые воронки, ограниченное количество Глубокие воронки, Journeys, когорты Funnels, Retention, Insights
BigQuery-экспорт Да (бесплатно, сырые данные) Да (подписка) Да (Enterprise)
Session Replay Нет Есть (iOS/Android SDK) Нет
Интеграция с рекламой Google Ads (нативная) Через Universal Links Через партнёров

Firebase Analytics — бесплатно, глубокая интеграция с Google Ads, BigQuery-экспорт для сырых данных. Ограничения: задержка данных до 24 часов, ограниченные воронки. Для стартапов с Google Ads трафиком — первый выбор.

Amplitude — продуктовая аналитика с акцентом на когорты и пути пользователя. Journeys (бывший Pathfinder) показывает реальные пути между событиями — не предполагаемые воронки, а фактические маршруты. Session Replay — запись сессий для UX-анализа. Бесплатный тир до 10 млн events/месяц достаточен для большинства продуктов на старте.

Mixpanel — ближе к Amplitude, сильнее в сегментации в реальном времени. Insights, Funnels, Retention — базовые инструменты, которые закрывают 90% аналитических задач продакта.

Более формальные определения этих платформ можно найти в Wikipedia и Wikipedia.

Как решить проблему мультиканальной атрибуции с AppsFlyer?

Знать откуда пришёл пользователь — отдельная задача. Firebase Attribution работает только внутри Google-экосистемы. Для мультиканальной атрибуции (Facebook Ads, TikTok, Apple Search Ads, programmatic) нужен MMP — Mobile Measurement Partner.

AppsFlyer — лидер рынка. OneLink — universal deep link, который работает на iOS и Android и корректно атрибутирует установку из любого канала. Protect360 — встроенная защита от fraud (фейковые установки, click injection на Android). Adjust и Branch — конкуренты с похожим функционалом. Branch силён в deep linking; Adjust популярен в gaming.

Согласно Apple, с iOS 14.5 приложения должны получать разрешение пользователя через ATT перед сбором IDFA для отслеживания. AppsFlyer использует probabilistic matching (IP + user agent + timing) для этих пользователей — точность ниже, но лучше чем ничего. SKAdNetwork и Privacy Preserving Attribution дают агрегированные данные от Apple с задержкой 24-72 часа.

Как настроить crash-аналитику, чтобы не пропускать баги?

Firebase Crashlytics — стандарт для crash reporting. Автоматически группирует крэши по стектрейсу, показывает affected users %, velocity alerts при росте crash rate более чем на 10% за час.

Важно: символикация. На iOS .dSYM файлы должны автоматически загружаться при каждой сборке — через Fastlane upload_symbols_to_crashlytics или Xcode Cloud built-in. Без символов крэш в Crashlytics выглядит как набор адресов памяти. Это происходит чаще чем кажется при переходе на новый CI — в одном проекте с аудиторией 500k пользователей мы обнаружили, что 40% крэшей оставались несимволизированными из-за пропущенного этапа в CI/CD. После автоматизации время реакции на баги сократилось с 3 часов до 15 минут.

Для React Native и Flutter — @sentry/react-native и sentry_flutter дают дополнительный контекст: breadcrumbs, сетевые запросы перед крэшем, состояние Redux/Provider.

Ниже — сравнение популярных инструментов crash-аналитики для выбора под свои задачи.

Критерий Firebase Crashlytics Sentry Instabug
Бесплатный лимит Безлимит (в рамках Spark) 5k events/мес 250 MAU
Группировка По стектрейсу + параметры По fingerprint По стектрейсу + метаданные
Символикация Автоматическая (через файл) Автоматическая (через CLI) Автоматическая
Velocity alerts Да (по % изменения) Да (по количеству) Да (по порогу)
Доп. контекст Logs, Keys, Custom Keys Breadcrumbs, User, Tags User steps, сетевые запросы
Цена Бесплатно (в Firebase) От $26/мес (Team) От $99/мес

Настройка окружения

Три окружения с отдельными Firebase проектами: dev, staging, production. Смешивать аналитику из тестовых сессий и production — распространённая ошибка, которая искажает все метрики. На iOS через GoogleService-Info.plist для каждой схемы, на Android через google-services.json в папке каждого flavor.

Сроки: базовая аналитика с Firebase + Crashlytics — 3-5 дней. Полноценный tracking plan + Amplitude/Mixpanel с воронками и когортами — 2-3 недели. Атрибуция через AppsFlyer с deep linking и fraud protection — 1-2 недели. Стоимость рассчитывается индивидуально в зависимости от сложности интеграций.

Что входит в нашу работу

В рамках внедрения аналитики мы предоставляем:

  • Разработку и согласование tracking plan с командами продукта и маркетинга.
  • Интеграцию SDK (Firebase, Amplitude, Mixpanel, AppsFlyer) с учётом вашего стека (Swift/Kotlin/Flutter/React Native).
  • Настройку воронок, когорт, дашбордов и алертов.
  • Автоматизацию символикации и загрузки .dSYM через Fastlane.
  • Документацию по событиям и параметрам.
  • Обучение команды работе с аналитической платформой.
  • Две недели пост-релизной поддержки и корректировки трекинга.

Наш опыт — 7 лет внедрения аналитики и более 80 успешных проектов в сфере мобильной разработки. Мы гарантируем корректность данных и прозрачность каждого этапа.

Свяжитесь с нами, чтобы получить консультацию по настройке аналитики вашего приложения. Закажите аудит текущей аналитики — и мы покажем, какие метрики вы теряете.