Проверка гипотез
Гипотезы, мощность, выбор критерия, множественные сравнения и байесовский против частотного вывод.
12 вопросов
JuniorТеорияОчень частоКак формулируют H₀ и H₁ и почему тест может только отвергнуть H₀, но не доказать её?
Как формулируют H₀ и H₁ и почему тест может только отвергнуть H₀, но не доказать её?
H₀ — гипотеза об отсутствии эффекта (status quo); H₁ — подозреваемый эффект. Тест исходит из H₀ и смотрит, насколько удивительны данные: удивительные отвергают H₀, иначе её лишь не отвергают — что не доказывает истинность H₀.
Типичные ошибки
- ✗Менять местами H₀ и H₁, делая эффект нулевой гипотезой
- ✗Читать незначимый результат как доказательство отсутствия эффекта
- ✗Утверждать, что тест доказывает H₀, а не просто не отвергает её
Уточняющие вопросы
- →Что на самом деле позволяет доложить продуктовой команде «не отвергли H₀»?
- →Почему незначимый результат — не то же самое, что доказательство отсутствия эффекта?
JuniorТеорияОчень частоИзменение даёт статистически значимый прирост +0.05% — почему его всё равно можно не катить?
Изменение даёт статистически значимый прирост +0.05% — почему его всё равно можно не катить?
Статистическая значимость говорит лишь, что эффект, вероятно, не ноль, но не насколько он велик. Прирост +0.05% может быть слишком мал, чтобы оправдать затраты, усложнение и guardrail-риск. Практическая значимость спрашивает, берёт ли он важный бизнес-порог.
Типичные ошибки
- ✗Считать любой значимый результат автоматически достойным запуска
- ✗Полагать, что большая выборка увеличит сам измеренный эффект
- ✗Приравнивать меньшее p-value к большему, более полезному эффекту
Уточняющие вопросы
- →Как задать минимальный практически значимый эффект до запуска эксперимента?
- →Почему очень большая выборка может сделать ничтожный эффект статистически значимым?
JuniorТеорияОчень частоКогда односторонний тест уместен и почему в экспериментах это обычно тревожный сигнал?
Когда односторонний тест уместен и почему в экспериментах это обычно тревожный сигнал?
Односторонний тест кладёт всю alpha на одну сторону, улавливая эффект лишь в заранее заданном направлении. Уместно, когда другое направление не важно, но тревожно: на него переходят после данных, чтобы вдвое уменьшить p-value.
Типичные ошибки
- ✗Выбирать сторону после того, как увидели, куда сдвинулась метрика
- ✗Считать односторонний тест просто более мощным без всякой платы
- ✗Думать, что односторонний тест проверяет оба направления сразу
Уточняющие вопросы
- →Как переход на односторонний тест меняет p-value для тех же данных?
- →Какая пре-регистрация сделала бы односторонний тест оправданным?
JuniorТеорияЧастоКакой критерий подходит для конверсии, какой — для среднего чека, а какой — для категориальной разбивки?
Какой критерий подходит для конверсии, какой — для среднего чека, а какой — для категориальной разбивки?
Критерий подбирают под тип метрики. Конверсия — это доля → z-тест для двух долей (или эквивалентный chi-square). Средний чек — непрерывное среднее → двухвыборочный t-тест. Частоты по нескольким категориям против ожидаемых → chi-square тест независимости.
Типичные ошибки
- ✗Применять t-тест к флагам 0/1 конверсии вместо теста для долей
- ✗Считать суммы денег категориальными и брать chi-square
- ✗Выбирать критерий по силе корреляции, а не по типу данных
Уточняющие вопросы
- →Когда z-тест для двух долей совпадает с chi-square на таблице 2×2?
- →Почему непрерывная метрика вроде выручки требует t-тест, а не тест для долей?
MiddleТеорияЧастоBonferroni против Benjamini-Hochberg — family-wise error rate против false-discovery rate: что взять для дашборда из 40 метрик?
Bonferroni против Benjamini-Hochberg — family-wise error rate против false-discovery rate: что взять для дашборда из 40 метрик?
Bonferroni контролирует family-wise error rate — любое ложное срабатывание — проверяя каждую гипотезу на alpha/m, поэтому теряет мощность с ростом m. Benjamini-Hochberg контролирует false-discovery rate — долю ложных срабатываний среди отклонений — и мягче, лучше подходя дашборду из 40 метрик.
Типичные ошибки
- ✗Путать, какой метод контролирует FWER, а какой FDR
- ✗Думать, что оба просто делят alpha и эквивалентны
- ✗Считать, что контроль FDR строже контроля FWER
Уточняющие вопросы
- →Как пошаговая процедура Benjamini-Hochberg решает, какие p-value отклонить?
- →Когда на дашборде вы всё же предпочтёте Bonferroni вместо BH?
MiddleТеорияЧастоВы проверяете 20 метрик, и одна даёт p = 0.03 — какова вероятность, что это шум, и что делать?
Вы проверяете 20 метрик, и одна даёт p = 0.03 — какова вероятность, что это шум, и что делать?
При 20 независимых нулевых вероятность хотя бы одного ложного срабатывания — 1 − 0.95²⁰ ≈ 64%, поэтому одинокое p = 0.03 скорее шум. Поправьте на множественность через Bonferroni или Benjamini-Hochberg либо заранее объявите одну главную метрику, остальные считая разведочными.
Типичные ошибки
- ✗Читать одно p-value как 3-процентный шанс, что это шум
- ✗Думать, что чем больше метрик, тем надёжнее каждый результат
- ✗Усреднять p-value, чтобы оценить весь эксперимент
Уточняющие вопросы
- →Как меняется цифра 64%, если 20 метрик коррелированы?
- →В чём разница между главной и разведочной метрикой в этом случае?
MiddleТеорияЧастоПри n = 10 млн почти всё значимо — что тогда говорит p < 0.05 и на что смотреть вместо этого?
При n = 10 млн почти всё значимо — что тогда говорит p < 0.05 и на что смотреть вместо этого?
При огромном n стандартная ошибка сжимается, поэтому даже микроскопическая разница даёт p < 0.05. Значимость лишь подтверждает, что эффект не строго ноль, а не что он важен. Смотрите на величину эффекта и доверительный интервал против порога.
Типичные ошибки
- ✗Читать крошечное p-value как свидетельство большого эффекта
- ✗Доверять значимости сильнее при большом n, не глядя на величину эффекта
- ✗Лишь поднимать порог alpha, игнорируя доверительный интервал
Уточняющие вопросы
- →Почему доверительный интервал остаётся информативным, когда p-value перестаёт?
- →Как минимально обнаружимый эффект удержал бы вас от погони за ничтожными приростами?
MiddleТеорияЧастоt-тест Стьюдента против t-теста Уэлча — чем они отличаются по дисперсиям и почему Уэлч безопаснее по умолчанию?
t-тест Стьюдента против t-теста Уэлча — чем они отличаются по дисперсиям и почему Уэлч безопаснее по умолчанию?
Стьюдент предполагает общую дисперсию групп и объединяет их; Уэлч берёт дисперсию каждой группы и правит степени свободы. При неравных дисперсиях или размерах Стьюдент раздувает ошибку первого рода, а Уэлч держится у номинала — берите его по умолчанию.
Типичные ошибки
- ✗Путать, какой из тестов предполагает равные дисперсии
- ✗Считать, что различие в нормальности, а не в дисперсии
- ✗Полагать, что Уэлч сравнивает медианы, а не средние
Уточняющие вопросы
- →Как неравный размер групп вместе с неравной дисперсией искажает тест Стьюдента?
- →Почему тест Уэлча использует дробное число степеней свободы?
SeniorТеорияИногдаБайесовский вывод даёт P(B > A) = 93%, а частотный p-value равен 0.08 — что именно позволяет утверждать каждый?
Байесовский вывод даёт P(B > A) = 93%, а частотный p-value равен 0.08 — что именно позволяет утверждать каждый?
Байесовские 93% — прямая вероятность о параметре при данной модели и априоре, поэтому на этот риск можно опереться. Частотное p = 0.08 — это P(данные столь экстремальны | H₀); не пройдя 0.05, H₀ не отвергают и об эффекте заявить нельзя — это не P(H₁).
Типичные ошибки
- ✗Считать 1 минус p-value за P(эффект реален)
- ✗Читать p-value как вероятность истинности нулевой гипотезы
- ✗Называть байесовский апостериор просто субъективным и бесполезным
Уточняющие вопросы
- →Почему байесовский апостериор и p-value могут расходиться на одних и тех же данных?
- →Как выбор априора меняет то, что означает P(B > A) = 93%?
SeniorТеорияИногдаРанговый тест Манна-Уитни U на тяжелохвостой метрике выручки — что он проверяет и почему «медиана сдвинулась» — неверно?
Ранговый тест Манна-Уитни U на тяжелохвостой метрике выручки — что он проверяет и почему «медиана сдвинулась» — неверно?
Тест Манна-Уитни U проверяет стохастическое доминирование — обычно ли случайное значение из одной группы больше, чем из другой. Это не тест на медиану: он может быть значим при равных медианах или пропустить реальный сдвиг, когда распределения пересекаются. Он говорит, какая группа обычно больше, а не на сколько.
Типичные ошибки
- ✗Докладывать Манна-Уитни U как проверку разницы медиан
- ✗Считать его t-тестом по средним с удалёнными выбросами
- ✗Полагать, что ему нужны нормальные распределения с равной дисперсией
Уточняющие вопросы
- →Когда Манн-Уитни U может быть значим, хотя две медианы одинаковы?
- →Почему толкование как сдвига требует, чтобы у распределений была одинаковая форма?
SeniorТеорияИногдаARPU (средняя выручка на пользователя) — ratio-метрика: почему наивный t-тест занижает её дисперсию и что это исправляет?
ARPU (средняя выручка на пользователя) — ratio-метрика: почему наивный t-тест занижает её дисперсию и что это исправляет?
ARPU — отношение двух коррелированных случайных величин, X̄/Ȳ. Наивный построчный t-тест считает знаменатель фиксированным, а строки независимыми, игнорируя его случайность и внутрипользовательскую корреляцию, поэтому занижает дисперсию и завышает значимость. Delta-метод линеаризует X̄/Ȳ и восстанавливает истинную дисперсию.
Типичные ошибки
- ✗Считать знаменатель — число пользователей — фиксированным, а не случайным
- ✗Думать, что поправка важна только при малых размерах выборки
- ✗Полагать, что наивный тест завышает, а не занижает дисперсию
Уточняющие вопросы
- →Как несовпадение единицы анализа с единицей рандомизации порождает эту проблему?
- →Когда вы возьмёте bootstrap вместо delta-метода?
SeniorТеорияИногдаt-тесту нужны нормальные данные или нормальные выборочные средние — когда спасает центральная предельная теорема, а когда нет?
t-тесту нужны нормальные данные или нормальные выборочные средние — когда спасает центральная предельная теорема, а когда нет?
t-тесту нужно приблизительно нормальное распределение выборочного среднего, а не сырых данных. По ЦПТ при большом n среднее почти нормально даже для скошенных данных. Он подводит при малом n или столь тяжёлых хвостах, что среднее сходится медленно, — берут преобразование, ранговый тест или bootstrap.
Типичные ошибки
- ✗Требовать нормальности самих сырых данных при любом размере выборки
- ✗Полагать, что ЦПТ делает t-тест верным при любом размере выборки
- ✗Думать, что ЦПТ нормализует данные, а не среднее
Уточняющие вопросы
- →Насколько большая выборка нужна лог-нормальной метрике выручки, чтобы среднее выглядело нормальным?
- →Почему ранговый тест полностью обходит вопрос о нормальности?