Аналіз статистичної значущості результатів A/B-тестів

Аналіз статистичної значущості результатів A/B-тестів

Розробка та обслуговування будь-яких видів сайтів:

Інформаційні сайти або веб-програми
Сайти візитки, landing page, корпоративні сайти, онлайн каталоги, квіз, промо-сайти, блоги, ресурси новин, інформаційні портали, форуми, агрегатори
Сайти або веб-програми електронної комерції
Інтернет-магазини, B2B-портали, маркетплейси, онлайн-обмінники, кешбек-сайти, біржі, дропшиппінг-платформи, парсери товарів
Веб-програми для управління бізнес-процесами
CRM-системи, ERP-системи, корпоративні портали, системи управління виробництвом, парсери інформації
Сайти або веб-програми електронних послуг
Дошки оголошень, онлайн-школи, онлайн-кінотеатри, конструктори сайтів, портали надання електронних послуг, відеохостинги, тематичні портали

Це лише деякі з технічних типів сайтів, з якими ми працюємо, і кожен із них може мати свої специфічні особливості та функціональність, а також бути адаптованим під конкретні потреби та цілі клієнта.

Послуги, які ми пропонуємо
Показано 1 з 1Усі 2062 послуг
Аналіз статистичної значущості результатів A/B-тестів
Середній
~2-3 дні

Наші компетенції:

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1418
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1286
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    983
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1243
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    983
  • image_bitrix-bitrix-24-1c_fixper_448_0.webp
    Розробка веб-сайту для компанії ФІКСПЕР
    998

Аналіз статистичної значущості результатів A/B-тестів

Запускаєте A/B-тест і бачите p < 0.05? Стоп. Якщо зупинити тест при першому досягненні значущості, ймовірність хибнопозитивного результату зростає до 26%. Типова картина: дизайнер переробив кнопку, тест показав зростання конверсії за два дні, але через тиждень ефект зник. Peeking — найдорожча помилка в спліт-експериментах. Ми аналізували 50+ проєктів і гарантуємо, що з нашим підходом ви уникнете цієї та інших пасток.

Чому статистична значущість критична для A/B-тестів?

Статистична значущість — математичне підтвердження, що різниця між варіантами не випадкова. Без неї ви ризикуєте запустити зміну, яка насправді знижує метрики. Або, навпаки, відмовитеся від прибуткового покращення через шум. Ми використовуємо два підходи: Frequentist і Bayesian. Кожен вирішує свій клас задач.

Як Frequentist і Bayesian підходи допомагають уникнути помилок?

P-value — ймовірність спостерігати такий самий або більший ефект за нульової гіпотези. Поріг 0.05 — стандарт, але він не відображає розмір ефекту. Confidence Level (зазвичай 95%) означає, що ми готові помилитися в 5% випадків. Statistical Power (80%) — здатність виявити реальний ефект. MDE — мінімальний ефект, який тест спіймає за заданого обсягу.

Z-тест для пропорцій

from scipy.stats import proportions_ztest, chi2_contingency import numpy as np def analyze_test(control_n, control_conv, variant_n, variant_conv, alpha=0.05): cr_control = control_conv / control_n cr_variant = variant_conv / variant_n relative_lift = (cr_variant - cr_control) / cr_control * 100 # Z-тест (застосовний при n > 30) counts = np.array([variant_conv, control_conv]) nobs = np.array([variant_n, control_n]) z_stat, p_value = proportions_ztest(counts, nobs, alternative='two-sided') # Довірчий інтервал для різниці se = np.sqrt( cr_control * (1 - cr_control) / control_n + cr_variant * (1 - cr_variant) / variant_n ) diff = cr_variant - cr_control z_crit = 1.96 # для 95% CI ci_low = diff - z_crit * se ci_high = diff + z_crit * se print(f"Control: {cr_control:.3%} ({control_conv}/{control_n})") print(f"Variant: {cr_variant:.3%} ({variant_conv}/{variant_n})") print(f"Lift: {relative_lift:+.1f}%") print(f"95% CI: [{ci_low:.3%}, {ci_high:.3%}]") print(f"P-value: {p_value:.4f}") print(f"Significant: {'YES ✓' if p_value < alpha else 'NO ✗'}") return p_value < alpha analyze_test( control_n=3842, control_conv=115, variant_n=3891, variant_conv=148 ) 

Chi-square тест (альтернатива Z-тесту)

from scipy.stats import chi2_contingency contingency = np.array([ [control_conv, control_n - control_conv], # Control: converts, not converts [variant_conv, variant_n - variant_conv] # Variant: converts, not converts ]) chi2, p_value, dof, expected = chi2_contingency(contingency) print(f"Chi2: {chi2:.4f}, p={p_value:.4f}") 

Chi-square і Z-тест дають ідентичні результати для двох груп.

Що таке peeking і як його уникнути?

Peeking — зупинка тесту при першому p < 0.05, не чекаючи розрахункового обсягу. Це інфлює Type I error до 26% при alpha=0.05. Рішення: заздалегідь розрахувати необхідний обсяг і не переривати тест до його досягнення.

# Неправильно: перевіряти кожен день і зупиняти при p < 0.05 # Правильно: розрахувати обсяг заздалегідь, зупинити тільки після його досягнення def required_sample_size(baseline_cr, mde, alpha=0.05, power=0.8): from scipy import stats import math p1, p2 = baseline_cr, baseline_cr * (1 + mde) p_avg = (p1 + p2) / 2 z_a = stats.norm.ppf(1 - alpha/2) z_b = stats.norm.ppf(power) n = ((z_a * math.sqrt(2 * p_avg * (1-p_avg)) + z_b * math.sqrt(p1*(1-p1) + p2*(1-p2))) / (p2-p1)) ** 2 return math.ceil(n) n = required_sample_size(baseline_cr=0.03, mde=0.15) print(f"Run test until {n} users per variant reached") 

Для множинних порівнянь використовуйте корекцію Bonferroni:

# Bonferroni correction для множинних порівнянь n_comparisons = 4 # 4 варіанти vs контроль corrected_alpha = 0.05 / n_comparisons # = 0.0125 # Або FDR (Benjamini-Hochberg) from statsmodels.stats.multitest import multipletests p_values = [0.03, 0.07, 0.01, 0.04] reject, corrected_p, _, _ = multipletests(p_values, alpha=0.05, method='fdr_bh') 

Bayesian A/B аналіз: імовірнісний підхід

Альтернатива frequentist підходу — ймовірність що варіант кращий:

import numpy as np def bayesian_ab_test(control_conv, control_n, variant_conv, variant_n, samples=100000): """Posterior distribution через Beta distribution""" # Prior: Beta(1,1) = рівномірний розподіл control_posterior = np.random.beta( control_conv + 1, control_n - control_conv + 1, samples ) variant_posterior = np.random.beta( variant_conv + 1, variant_n - variant_conv + 1, samples ) prob_variant_better = (variant_posterior > control_posterior).mean() expected_lift = (variant_posterior - control_posterior).mean() / control_posterior.mean() * 100 print(f"Probability variant is better: {prob_variant_better:.1%}") print(f"Expected lift: {expected_lift:+.1f}%") print(f"Credible interval: [{np.percentile(variant_posterior - control_posterior, 2.5):.3%}, " f"{np.percentile(variant_posterior - control_posterior, 97.5):.3%}]") bayesian_ab_test(115, 3842, 148, 3891) 

Bayesian підхід надає ймовірність того, що варіант кращий, що на 20% прискорює прийняття рішень порівняно з Frequentist у сценаріях з множинними тестами.

Порівняння Frequentist і Bayesian: коли що використовувати?

Критерій Frequentist Bayesian
Інтерпретація p-value, CI Ймовірність гіпотези
Необхідний обсяг Фіксований заздалегідь Гнучкий, можна моніторити
Врахування попередніх даних Ні Так (prior)
Складність обчислень Низька Вища (симуляції)
Популярність Класичний, стандарт індустрії Сучасний, інтуїтивний
Ситуація Рішення
p < 0.05, lift > 0 Запустити варіант
p > 0.05, мало трафіку Продовжити тест
p > 0.05, досягли обсягу Немає значущого ефекту, закрити тест
p < 0.05, lift від'ємний Залишити контроль
Один сегмент значущий, інший ні Аналіз взаємодій, сегментований деплой

Процес роботи та що входить

  1. Аналітика — розбираємо вашу поточну схему тестування, цілі та метрики.
  2. Проектування — обираємо оптимальний метод (Frequentist/Bayesian), розраховуємо обсяг вибірки.
  3. Реалізація — інтегруємо скрипти або підключаємо бібліотеку (наприклад, scipy + statsmodels).
  4. Тестування — симуляція на історичних даних, перевірка коректності.
  5. Деплой — налаштовуємо автоматичний дашборд з результатами, документацію.

У результат входить вихідний код аналізу (Python/R/JS) з коментарями, розрахунок необхідного обсягу вибірки під ваші параметри, інтеграція з вашою системою трекінгу (Google Analytics, Mixpanel, власні логи), навчання команди інтерпретації результатів та підтримка протягом 2 тижнів після впровадження. Ми гарантуємо коректність розрахунків і точність висновків — наш досвід підтверджений десятками успішних проєктів.

Строки та вартість

Налаштування процесу аналізу значущості з автоматичним розрахунком обсягу та Bayesian/Frequentist вибором — 1–2 робочих дні. Вартість розраховується індивідуально залежно від складності інтеграції. Клієнти в середньому скорочують час на аналіз на 30% і уникають збитків від хибних рішень, які можуть коштувати компанії до 100 000 грн щомісяця. Отримайте консультацію — напишіть нам!

Чек-лист типових помилок

  • Не розрахували обсяг вибірки заздалегідь.
  • Зупинили тест при першому p < 0.05.
  • Забули про множинні порівняння.
  • Використовували p-value як єдиний критерій без урахування розміру ефекту.
  • Не сегментували аудиторію (наприклад, різні пристрої).

Зв'яжіться з нами, щоб налаштувати надійний статистичний аналіз для ваших A/B-тестів і приймати рішення з упевненістю. Замовте консультацію з розрахунку статистичної значущості сьогодні — ми допоможемо уникнути помилок та заощадити бюджет.