Статистика
Меры центра, форма распределения, центральная предельная теорема и парадокс Симпсона.
18 вопросов
JuniorТеорияЧастоЧто такое мода, медиана и среднее арифметическое?
Что такое мода, медиана и среднее арифметическое?
Мода — самое частое значение. Медиана — серединное значение отсортированных данных, 50-й перцентиль, делящий выборку на две равные половины. Среднее арифметическое — сумма всех значений, делённая на их количество, точка баланса данных.
Типичные ошибки
- ✗Путать медиану со средним на скошенных данных
- ✗Считать, что мода единственна — у набора может быть несколько мод
- ✗Полагать, что все три меры всегда совпадают
Уточняющие вопросы
- →Какая мера центра наиболее устойчива к выбросам и почему?
- →Когда для данных о доходах вы укажете медиану вместо среднего?
JuniorТеорияЧастоNULL, NaN и ноль в данных — почему это три разных утверждения?
NULL, NaN и ноль в данных — почему это три разных утверждения?
NULL означает, что значение неизвестно, NaN — неопределённый результат вроде 0/0, а ноль — реально измеренная величина. Смешивать их — портить среднее: подмена NULL нулями тянет его вниз и раздувает знаменатель, а случайный NaN отравляет сумму.
Типичные ошибки
- ✗Заменять NULL нулём и незаметно смещать среднее вниз
- ✗Позволять одному NaN расползаться по сумме вместо маскирования
- ✗Считать, что любой пропуск во всех столбцах значит одно и то же
Уточняющие вопросы
- →Как SQL AVG обрабатывает NULL и чем это отличается от pandas mean?
- →Когда замена на ноль — правильный выбор, а не источник смещения?
JuniorТеорияЧастоПочему для латентности сообщают p50 и p95, а не среднее — что показывают перцентили?
Почему для латентности сообщают p50 и p95, а не среднее — что показывают перцентили?
Перцентиль — значение, ниже которого лежит доля наблюдений: p95 — латентность, что бьют 95% запросов. Среднее прячет хвост: медленные вызовы его раздувают, а бимодальная смесь усредняется в невидимое значение. p50 — типичный случай, p95 — почти худший.
Типичные ошибки
- ✗Читать p95 как значение, что 95% запросов превышают, а не обгоняют
- ✗Усреднять перцентили по серверам, что лишено смысла
- ✗Сообщать только среднее и упускать тяжёлый или бимодальный хвост
Уточняющие вопросы
- →Почему нельзя усреднить p95 по шардам, чтобы получить общий p95?
- →Как оценить перцентиль по потоковому источнику данных?
JuniorТеорияЧастоЧто делает выборку репрезентативной и почему convenience-выборка активных пользователей врёт?
Что делает выборку репрезентативной и почему convenience-выборка активных пользователей врёт?
Репрезентативная выборка даёт каждому члену целевой совокупности известный ненулевой шанс попасть в неё, поэтому её состав отражает целое. Convenience-выборка активных пользователей перевешивает тяжёлое использование, поэтому метрики завышаются, и рост данных смещение не убирает.
Типичные ошибки
- ✗Считать большую выборку автоматически репрезентативной
- ✗Полагать, что смещение отбора усредняется с ростом данных
- ✗Доверять поведению активных пользователей как оценке всех
Уточняющие вопросы
- →Как перевзвесить convenience-выборку к составу совокупности?
- →Что такое ошибка выжившего (survivorship bias) и как она с этим связана?
JuniorТеорияЧастоСтандартная ошибка против стандартного отклонения — почему SE убывает с ростом n, а SD нет?
Стандартная ошибка против стандартного отклонения — почему SE убывает с ростом n, а SD нет?
Стандартное отклонение измеряет разброс сырых данных — свойство совокупности, что не убывает с ростом n. Стандартная ошибка — это SD выборочного распределения статистики, для среднего SD/√n, поэтому убывает с ростом n. SD — про наблюдения, SE — про точность оценки.
Типичные ошибки
- ✗Путать SE с SD и приводить не ту величину для оценки
- ✗Думать, что больше данных сужает разброс самих сырых значений
- ✗Забывать, что SE убывает лишь как корень из n
Уточняющие вопросы
- →Чтобы вдвое уменьшить стандартную ошибку среднего, во сколько раз нужно увеличить n?
- →Как вычислить стандартную ошибку доли?
JuniorТеорияЧастоДисперсия против стандартного отклонения — что измеряет каждая и почему в отчёте указывают SD?
Дисперсия против стандартного отклонения — что измеряет каждая и почему в отчёте указывают SD?
Дисперсия — это среднее квадратов отклонений от среднего, поэтому она в квадратных единицах. Стандартное отклонение — её квадратный корень, в исходных единицах данных и сравнимо со средним. SD указывают, ведь разброс «±5 кг» интерпретируем, а «25 кг²» — нет.
Типичные ошибки
- ✗Указывать дисперсию в квадратных единицах, будто она в шкале данных
- ✗Считать, что SD и дисперсия измеряют центр, а не разброс
- ✗Забывать, что складываются дисперсии независимых величин, а не SD
Уточняющие вопросы
- →Когда для оценки дисперсии делят на n, а когда на n−1?
- →Как ведёт себя стандартное отклонение для сильно скошенного распределения?
MiddleТеорияЧастоОдиночный заказ на ₽10 млн сдвигает среднее на 20% — trim, winsorize, cap или оставить выброс?
Одиночный заказ на ₽10 млн сдвигает среднее на 20% — trim, winsorize, cap или оставить выброс?
Сначала решите, реальный он или ошибка ввода. Настоящий заказ на ₽10 млн — сигнал: оставьте его и рядом со средним показывайте медиану, чтобы один «кит» не искажал типичное значение. Trim и winsorize занижают реальные итоги; исключайте лишь настоящие ошибки.
Типичные ошибки
- ✗Удалять экстремальное значение, не проверив, настоящее ли оно
- ✗Применять winsorize к реальной выручке и занижать итоги
- ✗Показывать только среднее, когда один «кит» его искажает
Уточняющие вопросы
- →Чем winsorize отличается от trim по действию на данные?
- →Когда устойчивая статистика вроде медианы лучше очистки выбросов?
JuniorТеорияИногдаЧто такое центральная предельная теорема и где она применяется в аналитике?
Что такое центральная предельная теорема и где она применяется в аналитике?
Центральная предельная теорема утверждает, что распределение выборочного среднего независимых одинаково распределённых величин с конечной дисперсией стремится к нормальному с ростом n при любой исходной форме. Это обосновывает доверительные интервалы и z/t-тесты для средних и лежит в основе проверки значимости в A/B.
Типичные ошибки
- ✗Утверждать, что нормальными становятся сырые данные, а не выборочное среднее
- ✗Забывать про условия конечной дисперсии и независимости
- ✗Считать, что фиксированное n вроде 30 делает результат точным, а не приближённым
Уточняющие вопросы
- →Как меняется сходимость для сильно скошенного исходного распределения?
- →Почему стандартная ошибка среднего убывает как корень из n?
JuniorТеорияИногдаРасположите моду, медиану и среднее в скошенном вправо распределении.
Расположите моду, медиану и среднее в скошенном вправо распределении.
Для скошенного вправо распределения (длинный правый хвост) порядок — мода < медиана < среднее. Длинный хвост больших значений сильнее тянет вверх среднее, слабее медиану, а мода — у плотного низкого края. При левой скошенности порядок обратный.
Типичные ошибки
- ✗Переворачивать порядок — это описывает левую, а не правую скошенность
- ✗Считать, что скошенность меняет разброс, но не взаимное положение центров
- ✗Забывать, что среднее сильнее всего тянется хвостом
Уточняющие вопросы
- →Чему равны мода, медиана и среднее для экспоненциального распределения?
- →Почему для скошенных данных о зарплатах предпочитают медиану, а не среднее?
JuniorТеорияИногдаНазовите несколько вероятностных распределений и где каждое применяется.
Назовите несколько вероятностных распределений и где каждое применяется.
Частые — нормальное (ошибки измерений), равномерное (равновероятные исходы), Бернулли/биномиальное (число успехов, например конверсии), Пуассона (число событий за интервал, например приходы), экспоненциальное (время ожидания) и логнормальное (величины вроде дохода). Каждое дискретное или непрерывное.
Типичные ошибки
- ✗Перечислять меры разброса вместо названных распределений
- ✗Считать всё нормальным из-за центральной предельной теоремы
- ✗Смешивать дискретные и непрерывные без указания сценария применения
Уточняющие вопросы
- →Какое распределение моделирует число кликов по баннеру за час?
- →Когда метрику моделируют логнормальным, а не нормальным распределением?
MiddleТеорияИногдаКак оценить размер выборки для детекции 2% прироста — какие четыре входа в формуле?
Как оценить размер выборки для детекции 2% прироста — какие четыре входа в формуле?
Его задают четыре входа: базовая дисперсия метрики, минимальный детектируемый эффект (прирост 2%), уровень значимости α и мощность 1−β. n растёт с дисперсией и (z_α+z_β)² и падает как квадрат эффекта — так что вдвое меньший прирост учетверяет n.
Типичные ошибки
- ✗Считать мощность или дисперсию выходом, а не входом
- ✗Полагать, что размер выборки растёт линейно с эффектом
- ✗Игнорировать базовую дисперсию при планировании теста
Уточняющие вопросы
- →Почему вдвое меньший минимальный детектируемый эффект примерно учетверяет выборку?
- →Как переход к одностороннему тесту меняет нужное n?
JuniorТеорияРедкоЗакон больших чисел против центральной предельной теоремы — какие две теоремы путают?
Закон больших чисел против центральной предельной теоремы — какие две теоремы путают?
Закон больших чисел говорит, что выборочное среднее сходится к истинному по мере роста n — он про то, куда попадает среднее. Центральная предельная теорема говорит, что распределение этого выборочного среднего приближается к нормальному, какой бы ни была форма, — она про ошибку вокруг него.
Типичные ошибки
- ✗Путать, какая теорема обещает сходимость, а какая описывает форму
- ✗Думать, что нормальными становятся сырые данные, а не выборочное среднее
- ✗Считать, что какой-то из теорем нужна нормальная исходная совокупность
Уточняющие вопросы
- →Какая теорема обосновывает доверительный интервал, а какая — точечную оценку при большом n?
- →Выполняется ли закон больших чисел при бесконечной дисперсии?
JuniorТеорияРедкоСредний чек вырос в каждой категории — может ли упасть средний чек платформы?
Средний чек вырос в каждой категории — может ли упасть средний чек платформы?
Да. Средний чек платформы может упасть, хотя в каждой категории он вырос, если доля сместилась к дешёвой категории. Это парадокс Симпсона — взвешенный агрегат зависит от весов, поэтому по трендам внутри категорий судить нельзя.
Типичные ошибки
- ✗Отвечать, что средний чек платформы тоже обязан вырасти
- ✗Игнорировать, что доля категорий (веса) меняет агрегат
- ✗Считать общий средний чек простой суммой средних по категориям
Уточняющие вопросы
- →Какой именно сдвиг долей категорий заставит средний чек платформы упасть?
- →Как защитить анализ от парадокса Симпсона?
MiddleТеорияРедкоПродажи мороженого коррелируют с утоплениями — назовите конфаундер и как его контролировать.
Продажи мороженого коррелируют с утоплениями — назовите конфаундер и как его контролировать.
Конфаундер — жаркая погода: зной гонит и продажи мороженого, и купание, поэтому ряды движутся вместе без причины. Контролируйте условием — стратифицируйте или регрессируйте на температуру или сезон. Если при фиксированной погоде связь исчезает, она была ложной.
Типичные ошибки
- ✗Читать сырую корреляцию как доказательство причинности
- ✗Не назвать правдоподобную третью переменную
- ✗Поправляться на переменную на причинном пути вместо конфаундера
Уточняющие вопросы
- →Чем конфаундер отличается от медиатора на причинном пути?
- →Почему поправка на коллайдер может создать ложную связь?
MiddleТеорияРедкоPearson's r ≈ 0 для двух переменных, что явно движутся вместе, — чего корреляция не видит?
Pearson's r ≈ 0 для двух переменных, что явно движутся вместе, — чего корреляция не видит?
Pearson's r измеряет только силу линейной связи. U-образная или немонотонная зависимость — вроде эффекта дозы, что растёт, потом падает, — усредняется до r ≈ 0, хотя переменные тесно связаны. Стройте scatter-график и берите Spearman для нелинейной зависимости.
Типичные ошибки
- ✗Читать r ≈ 0 как доказательство независимости
- ✗Пропускать scatter-график, доверяя корреляции
- ✗Забывать, что одни выбросы могут гнать r вверх или вниз
Уточняющие вопросы
- →Как ранговая корреляция Spearman справляется с монотонной нелинейной связью?
- →Что низкий r говорит о сильной квадратичной зависимости?
MiddleТеорияРедкоMCAR, MAR и MNAR — как механизм пропусков решает, смещает ли удаление строк результат?
MCAR, MAR и MNAR — как механизм пропусков решает, смещает ли удаление строк результат?
MCAR означает, что пропуск не связан ни с чем, поэтому удаление строк лишь теряет мощность. MAR означает зависимость от наблюдаемых переменных — удалять можно, условившись на них, иначе смещение. MNAR означает зависимость от скрытого значения, поэтому удаление всегда смещает оценку.
Типичные ошибки
- ✗Считать любой пропуск MCAR и удалять строки по умолчанию
- ✗Импутировать среднее при MNAR и считать смещение устранённым
- ✗Путать, сколько пропущено, с тем, почему пропущено
Уточняющие вопросы
- →Как проверить, MAR перед вами или MNAR?
- →Когда multiple imputation лучше простого анализа полных случаев?
SeniorДебаггингРедкоA/A-тест дал значимость на чистой выборке — selection bias, подглядывание или невезение?
A/A-тест дал значимость на чистой выборке — selection bias, подглядывание или невезение?
У A/A-теста нет реального эффекта, поэтому p = 0.036 ожидаем — при α = 0.05 значимость случайно даёт 5% чистых A/A-тестов. Ключ — подглядывание (peeking): остановка на первом p < 0.05 раньше горизонта раздувает долю ложных срабатываний. Сбалансированный сплит исключает selection bias.
Открыть задачу →Типичные ошибки
- ✗Читать любой одиночный значимый A/A как сломанный пайплайн
- ✗Считать повторные дневные просмотры независимыми и безвредными
- ✗Забывать, что доля ложных срабатываний 5% относится и к A/A-тестам
Уточняющие вопросы
- →Как методы sequential testing контролируют проблему подглядывания?
- →Какая проверка sample-ratio подтвердит, что сплит и правда сбалансирован?
SeniorТеорияРедкоПочему bootstrap-интервал (ресэмплинг) вообще работает и когда bootstrap отказывает?
Почему bootstrap-интервал (ресэмплинг) вообще работает и когда bootstrap отказывает?
Ресэмплинг берёт выборку как прокси совокупности, поэтому разброс статистики приближает выборочное распределение, давая стандартную ошибку без формулы. Работает, ведь эмпирическое распределение близко к настоящему, и отказывает на статистиках хвостов, вроде максимума, и на крошечных выборках.
Типичные ошибки
- ✗Думать, что bootstrap предполагает нормальность данных
- ✗Ресэмплить крайний квантиль или максимум и доверять интервалу
- ✗Применять его к крошечной выборке, что не представляет совокупность
Уточняющие вопросы
- →Чем percentile bootstrap отличается от интервала BCa?
- →Почему bootstrap плохо оценивает выборочный максимум?