A/B тестирование
A/B тест — это проверка статистической гипотезы, надетая на продуктовое решение: делим пользователей на две группы, показываем разный вариант и решаем, реальна ли разница в метрике или это случайный шум. Всё держится на аппарате проверки гипотез — нулевая и альтернативная, p-value, уровень значимости, мощность.
Ловушки здесь концептуальные, а не арифметические, и именно их проверяют на собеседовании: p-value читают как «вероятность, что гипотеза верна»; тест останавливают, едва p упал ниже 0.05; долю сравнивают t-тестом по агрегатам. Ниже — девять понятий, из которых собирается корректный эксперимент: от определения ошибок и p-value до расчёта выборки и компромиссов при организации теста.
Карта темы
- Ошибки первого и второго рода — ложное срабатывание (alpha) против пропуска эффекта (beta) и компромисс между ними.
- p-value — вероятность данных при верной нулевой гипотезе, а не вероятность самой гипотезы.
- Статистическая мощность — шанс поймать реальный эффект, равный
1 - beta, и что его повышает. - Доверительный интервал — диапазон для истинного параметра и его частотный смысл.
- Критерий для долей — z-тест и хи-квадрат для метрик вида «кликнул / не кликнул».
- Выбор статистического критерия — подбор теста под тип метрики: доля, среднее, отношение.
- Минимальный детектируемый эффект (MDE) — наименьший эффект, который тест способен различить.
- Дизайн A/B теста — расчёт объёма выборки и длительности без подглядывания.
- Компромиссы эксперимента — организация, стоимость, альтернативы и доверие к хрупким результатам.
Частые ошибки и ловушки
| Ошибка | Последствие |
|---|---|
| Читать p-value как вероятность истинности нулевой гипотезы | Полное непонимание логики теста — грубейший провал |
Останавливать тест при первом p < 0.05 (подглядывание) | Раздутая доля ложных срабатываний, хрупкий «эффект» |
| Сравнивать доли (CTR) t-тестом по агрегатам | Неверный критерий — нужны побинарные данные и z-тест/хи-квадрат |
| Путать «включает 0» и «значим» для доверительного интервала | Значим интервал, который НЕ включает 0, а не наоборот |
| Считать MDE наблюдаемым эффектом или потолком | MDE — порог чувствительности на этапе дизайна, задаётся заранее |
| Игнорировать дисперсию при расчёте выборки | Шумной метрике нужно кратно больше n при том же MDE |
Значение для собеседований
A/B тест — любимая тема продуктовых секций, потому что он разом проверяет статистику и продуктовое мышление. Кандидат, который различает «данные при нулевой» и «вероятность нулевой», проговаривает связь alpha–beta–мощность–выборка и подбирает критерий под тип метрики, сразу выглядит как человек, которому можно доверить боевой эксперимент.
Что обычно проверяют:
- Точное определение p-value и то, чем оно не является.
- Ошибки первого и второго рода, их доли (alpha, beta) и связь с мощностью.
- Как объём выборки зависит от alpha, мощности, дисперсии и MDE.
- Выбор критерия: доля — z-тест/хи-квадрат, среднее — t-тест.
- Почему нельзя останавливать тест рано и что такое подглядывание.
Типичный неверный ответ: «p-value 0.03 значит 97% шанс, что эффект реален». На деле p-value — это вероятность увидеть такие или более экстремальные данные при условии, что нулевая гипотеза верна, а не вероятность самой гипотезы.