Налаштування A/B тестування в мобільному додатку
Ви запускаєте A/B тест, через три дні бачите p-value 0.04 і зупиняєте експеримент. Результат — хибнопозитивний. Таке трапляється в 80% мобільних A/B тестів, якщо вірити аналітиці. Причина — порушення базової статистики: множинні перевірки та передчасна зупинка. A/B тестування — потужний інструмент, але тільки при правильному налаштуванні. Наш досвід у мобільній розробці — понад 50 впроваджених A/B тестів на iOS та Android. Гарантуємо коректне налаштування та статистично значущі результати. Зв'яжіться з нами для консультації.
Як вибрати інструмент для A/B тестування?
| Інструмент |
Підходить для |
Мінус |
| Firebase A/B Testing |
Прості UI/текст/параметри |
Обмежена гнучкість таргетингу |
| Amplitude Experiment |
Продуктові гіпотези з аналізом retention |
Платний, вимагає Amplitude Analytics |
| Statsig |
Повний цикл: флаги, експерименти, аналіз |
Вимагає налаштування |
| Growthbook |
Open-source, self-hosted |
Інфраструктурні витрати |
Firebase A/B Testing — розумний старт для більшості проєктів. Інтеграція через Remote Config, без додаткових SDK. Для складної сегментації (користувачі з Києва з трьома сесіями) Statsig втричі ефективніший за рахунок стратифікованої вибірки.
Чому більшість A/B тестів дають хибнопозитивні результати?
Зупинка тесту при перших значущих результатах — найпоширеніша помилка. Якщо дивитися на p-value щодня і зупинити тест коли p < 0.05 вперше — ймовірність хибнопозитивного результату може зрости до 30%. Тест потрібно зупиняти, коли досягнуто заздалегідь визначеного розміру вибірки.
Один тест — одна метрика. Не можна оптимізувати одночасно conversion rate та session length одним тестом. Якщо обидві метрики зростають — добре, але таргетна має бути одна.
Novelty effect. Новий дизайн дає сплеск кліків на першому тижні просто тому що він новий. Для поведінкових тестів мінімальний термін — 2 тижні. Для retention-тестів — 4 тижні.
Коли потрібно зупиняти A/B тест?
Тест потрібно зупиняти тільки при досягненні заздалегідь розрахованого розміру вибірки. Не можна покладатися на поточне p-value. Використовуйте калькулятор розміру вибірки: вкажіть baseline конверсію, мінімальний ефект (MDE) та довірчий інтервал (зазвичай 95%). Наприклад, для baseline 10% і MDE 1% потрібно близько 10 000 користувачів на варіант.
Firebase A/B Testing: налаштування
Firebase A/B Testing будується поверх Remote Config. Спочатку визначаємо параметр:
// Отримуємо значення з Remote Config
let remoteConfig = RemoteConfig.remoteConfig()
remoteConfig.configSettings = RemoteConfigSettings()
remoteConfig.configSettings.minimumFetchInterval = 0 // в debug
remoteConfig.fetchAndActivate { status, error in
let ctaText = remoteConfig.configValue(forKey: "checkout_cta_text").stringValue
self.checkoutButton.setTitle(ctaText, for: .normal)
}
У Firebase Console → A/B Testing створюємо експеримент:
- Обираємо
checkout_cta_text як Target Parameter
- Control: "Оформити замовлення"
- Variant A: "Купити зараз"
- Цільова метрика:
purchase (конверсійна подія)
- Відсоток учасників: 50%
- Мінімальний розмір вибірки: Firebase розраховує автоматично
Статистична значущість: неочевидні підводні камені
| Проблема |
Наслідок |
Рішення |
| Множинні перевірки (peeking) |
Хибні спрацьовування |
Заздалегідь фіксувати розмір вибірки |
| Декілька метрик |
Переоптимізація |
Обрати одну первинну метрику |
| Новизна (novelty effect) |
Завищені результати |
Мінімум 2 тижні для UI-тестів |
Statsig для складних експериментів
Відзначимо: коли потрібна більш гнучка сегментація (тестуємо тільки на користувачах з Києва, у яких > 3 сесій):
// iOS Statsig SDK
import StatsigSDK
Statsig.initialize(sdkKey: "client-xxx") {
let experiment = Statsig.getExperiment("checkout_flow_v2")
let variant = experiment.getValue(forKey: "flow_type", defaultValue: "standard")
if variant == "simplified" {
self.showSimplifiedCheckout()
} else {
self.showStandardCheckout()
}
}
// Android
val experiment = Statsig.getExperiment("checkout_flow_v2")
val flowType = experiment.getString("flow_type", "standard")
Statsig підтримує стратифіковану вибірку — рівномірний розподіл користувачів по стратах (платформа, країна, план підписки). Без стратифікації випадковий розподіл може створити когорти з різним складом, що спотворює результати.
Логування експозиції
Для коректного аналізу важливо логувати факт показу варіанту — не тільки конверсію:
Analytics.logEvent("experiment_exposure", parameters: [
"experiment_id": "checkout_cta_v2",
"variant": variantName,
"user_id": userId
])
Це дозволяє аналізувати конверсію тільки серед користувачів, які реально бачили експеримент, а не всіх учасників.
Що входить в роботу
- Вибір інструменту під завдання та стек (Firebase / Statsig / Amplitude Experiment)
- Інтеграція SDK та налаштування Remote Config / Feature Flags
- Реалізація шару A/B в коді з коректною обробкою варіантів
- Налаштування цільових метрик та конверсійних подій
- Конфігурація розміру вибірки та тривалості тесту
- Логування експозиції для аналізу
- Пост-тест аналіз з перевіркою статистичних припущень
- Документування результатів
Терміни
Один A/B тест на Firebase Remote Config: 1–2 дні. Інфраструктура для регулярного A/B тестування (Statsig/Growthbook): 3–5 днів. Вартість розраховується індивідуально. Оцінимо ваш проєкт — зв'яжіться з нами для консультації. Гарантуємо прозору звітність та коректні експерименти. Замовте реалізацію A/B тестування — отримайте статистично значущі результати без хибних спрацьовувань.
Аналітика мобільних застосунків: Firebase, Amplitude, AppsFlyer та атрибуція
Наша команда регулярно стикається з проектами, де аналітика вже «налаштована», але реальних інсайтів немає. Типовий приклад — стартап з 50k DAU: трекінг десятків подій без жодної відповіді на питання «чому користувачі не доходять до оплати». За два тижні ми побудували базову воронку і з'ясували, що 70% аудиторії відвалюється на екрані верифікації номера телефону. Після локалізації бага retention зріс на 12%. Висновок: аналітика повинна починатися з конкретних питань, а не з трекінгу всього підряд.
Чому таксономія подій — основа аналітики мобільних застосунків?
Firebase Analytics, Amplitude, Mixpanel — технічно схожі. Різниця в тому, що ви в них кладете. Типова помилка: події screen_view, button_tap_1, button_tap_2 без контексту. Через місяць ніхто не пам'ятає, що таке button_tap_2.
Правильна таксономія: об'єкт + дія + контекст. product_viewed, checkout_started, payment_completed з параметрами product_id, category, price, source. Це дозволяє будувати воронки, когортний аналіз та retention без додаткового трекінгу.
Ми фіксуємо naming convention у tracking plan — документі (Google Sheet або Amplitude Data Catalog), де описано кожну подію, її параметри та умови спрацьовування. Tracking plan синхронізується з командою аналітиків до початку розробки, а не після. Такий підхід гарантує, що через місяць дані залишаться інтерпретованими, а не перетворяться на звалище. Досвід впровадження на 50+ проектах підтверджує: при відсутності tracking plan вартість підтримки аналітики зростає у 2-3 рази за рахунок переробок.
Що обрати для аналітики мобільних застосунків: Firebase, Amplitude чи Mixpanel?
Таблиця нижче показує ключові відмінності трьох популярних платформ. Вибір залежить від бюджету, трафіку та завдань.
| Критерій |
Firebase Analytics |
Amplitude |
Mixpanel |
| Безкоштовний ліміт |
Безліміт (в рамках Spark-плану) |
До 10 млн events/міс |
До 1 тис. MTU/міс (Special) |
| Затримка даних |
До 24 годин (стандарт) |
Хвилини (real-time) |
Хвилини (real-time) |
| Воронки та когорти |
Базові воронки, обмежена кількість |
Глибокі воронки, Journeys, когорти |
Funnels, Retention, Insights |
| BigQuery-експорт |
Так (безкоштовно, сирі дані) |
Так (підписка) |
Так (Enterprise) |
| Session Replay |
Ні |
Є (iOS/Android SDK) |
Ні |
| Інтеграція з рекламою |
Google Ads (нативна) |
Через Universal Links |
Через партнерів |
Firebase Analytics — безкоштовно, глибока інтеграція з Google Ads, BigQuery-експорт для сирих даних. Обмеження: затримка даних до 24 годин, обмежені воронки. Для стартапів з Google Ads трафіком — перший вибір.
Amplitude — продуктова аналітика з акцентом на когорти та шляхи користувача. Journeys (колишній Pathfinder) показує реальні шляхи між подіями — не передбачувані воронки, а фактичні маршрути. Session Replay — запис сесій для UX-аналізу. Безкоштовний тир до 10 млн events/місяць достатній для більшості продуктів на старті.
Mixpanel — ближче до Amplitude, сильніший у сегментації в реальному часі. Insights, Funnels, Retention — базові інструменти, які закривають 90% аналітичних завдань продакта.
Більш формальні визначення цих платформ можна знайти у Wikipedia (Firebase) та Wikipedia (Amplitude).
Як вирішити проблему мультиканальної атрибуції з AppsFlyer?
Знати звідки прийшов користувач — окреме завдання. Firebase Attribution працює лише всередині Google-екосистеми. Для мультиканальної атрибуції (Facebook Ads, TikTok, Apple Search Ads, programmatic) потрібен MMP — Mobile Measurement Partner.
AppsFlyer — лідер ринку. OneLink — universal deep link, який працює на iOS та Android і коректно атрибутує встановлення з будь-якого каналу. Protect360 — вбудований захист від fraud (фейкові встановлення, click injection на Android). Adjust та Branch — конкуренти з подібним функціоналом. Branch сильний у deep linking; Adjust популярний у gaming.
Згідно з Apple, з iOS 14.5 застосунки повинні отримувати дозвіл користувача через ATT перед збором IDFA для відстеження. AppsFlyer використовує probabilistic matching (IP + user agent + timing) для цих користувачів — точність нижча, але краще ніж нічого. SKAdNetwork та Privacy Preserving Attribution надають агреговані дані від Apple із затримкою 24-72 години.
Як налаштувати crash-аналітику, щоб не пропускати баги?
Firebase Crashlytics — стандарт для crash reporting. Автоматично групує креші за стектрейсом, показує affected users %, velocity alerts при зростанні crash rate більш ніж на 10% за годину.
Важливо: символікація. На iOS .dSYM файли повинні автоматично завантажуватися при кожній збірці — через Fastlane upload_symbols_to_crashlytics або Xcode Cloud built-in. Без символів креш у Crashlytics виглядає як набір адрес пам'яті. Це трапляється частіше, ніж здається при переході на новий CI — в одному проекті з аудиторією 500k користувачів ми виявили, що 40% крешів залишалися несимволізованими через пропущений етап у CI/CD. Після автоматизації час реакції на баги скоротився з 3 годин до 15 хвилин.
Для React Native та Flutter — @sentry/react-native та sentry_flutter дають додатковий контекст: breadcrumbs, мережеві запити перед крешем, стан Redux/Provider.
Нижче — порівняння популярних інструментів crash-аналітики для вибору під свої завдання.
| Критерій |
Firebase Crashlytics |
Sentry |
Instabug |
| Безкоштовний ліміт |
Безліміт (в рамках Spark) |
5k events/міс |
250 MAU |
| Групування |
За стектрейсом + параметри |
За fingerprint |
За стектрейсом + метадані |
| Символікація |
Автоматична (через файл) |
Автоматична (через CLI) |
Автоматична |
| Velocity alerts |
Так (за % зміни) |
Так (за кількістю) |
Так (за порогом) |
| Дод. контекст |
Logs, Keys, Custom Keys |
Breadcrumbs, User, Tags |
User steps, мережеві запити |
| Ціна |
Безкоштовно (у Firebase) |
Від $26/міс (Team) |
Від $99/міс |
Налаштування оточення
Три оточення з окремими Firebase проектами: dev, staging, production. Змішувати аналітику з тестових сесій і production — поширена помилка, яка спотворює всі метрики. На iOS через GoogleService-Info.plist для кожної схеми, на Android через google-services.json у папці кожного flavor.
Терміни: базова аналітика з Firebase + Crashlytics — 3-5 днів. Повноцінний tracking plan + Amplitude/Mixpanel з воронками та когортами — 2-3 тижні. Атрибуція через AppsFlyer з deep linking та fraud protection — 1-2 тижні. Вартість розраховується індивідуально залежно від складності інтеграцій.
Що входить у нашу роботу
В рамках впровадження аналітики ми надаємо:
- Розробку та узгодження tracking plan з командами продукту та маркетингу.
- Інтеграцію SDK (Firebase, Amplitude, Mixpanel, AppsFlyer) з урахуванням вашого стеку (Swift/Kotlin/Flutter/React Native).
- Налаштування воронок, когорт, дашбордів та алертів.
- Автоматизацію символікації та завантаження .dSYM через Fastlane.
- Документацію щодо подій та параметрів.
- Навчання команди роботі з аналітичною платформою.
- Два тижні пост-релізної підтримки та коригування трекінгу.
Наш досвід — 7 років впровадження аналітики та понад 80 успішних проектів у сфері мобільної розробки. Ми гарантуємо коректність даних і прозорість кожного етапу.
Зв'яжіться з нами, щоб отримати консультацію з налаштування аналітики вашого застосунку. Замовте аудит поточної аналітики — і ми покажемо, які метрики ви втрачаєте.