Теория вероятностей и статистика для ML
Метод максимального правдоподобия, теорема Байеса, корреляция и независимость, ЦПТ, p-value, распределения, доверительные интервалы и мощность/размер выборки.
14 вопросов
JuniorТеорияОчень частоЧто именно сходится к нормальному распределению по центральной предельной теореме?
Что именно сходится к нормальному распределению по центральной предельной теореме?
ЦПТ говорит о выборочном распределении среднего, а не о сырых данных. Средние независимых наблюдений с конечной дисперсией стремятся к нормальной форме с ростом n. Сами данные могут оставаться скошенными сколько угодно; теорема о них молчит.
Типичные ошибки
- ✗Утверждать, что сырые данные становятся нормальными при большой выборке
- ✗Забывать условие конечной дисперсии, которое нарушают тяжёлые хвосты
- ✗Применять теорему к одному наблюдению вместо среднего
Уточняющие вопросы
- →Какое распределение с тяжёлым хвостом ломает ЦПТ и почему?
- →Как ЦПТ обосновывает доверительный интервал у офлайн-оценки метрики?
JuniorТеорияОчень частоКакие распределения встречаются у целевых переменных в ML и что моделирует каждое?
Какие распределения встречаются у целевых переменных в ML и что моделирует каждое?
Bernoulli моделирует одну метку да/нет; binomial считает успехи в фиксированном числе испытаний. Poisson моделирует число событий в окне, например заказов в час. Нормальное описывает аддитивный шум у непрерывной цели, log-normal — скошенные мультипликативные величины.
Типичные ошибки
- ✗Путать Bernoulli и binomial, считая одну метку числом успехов
- ✗Подгонять нормальное распределение к строго положительной скошенной цели вроде цены
- ✗Считать, что распределение цели не влияет на выбор функции потерь
Уточняющие вопросы
- →Какая функция потерь следует из Poisson-цели и где вы её примените?
- →Почему логарифмирование скошенной вправо цели часто помогает линейной модели?
JuniorТеорияОчень частоЧто на самом деле означает 95% доверительный интервал и как масштабируется его ширина?
Что на самом деле означает 95% доверительный интервал и как масштабируется его ширина?
95% характеризуют процедуру, а не один интервал — повторите эксперимент, и 95% построенных так интервалов накроют истинный параметр. Ваш же либо накрыл его, либо нет. Ширина убывает как корень из n, поэтому сузить её вдвое стоит вчетверо данных.
Типичные ошибки
- ✗Говорить, что с вероятностью 95% параметр лежит в этом конкретном интервале
- ✗Путать доверительный интервал с разбросом самих наблюдений
- ✗Ждать, что ширина уменьшится вдвое при удвоении выборки
Уточняющие вопросы
- →Как превратить это правило ширины в оценку размера выборки для эксперимента?
- →Как байесовский аналог, credible interval, меняет саму формулировку?
JuniorТеорияЧастоПочему нулевая корреляция Пирсона не означает независимость, и когда означает?
Почему нулевая корреляция Пирсона не означает независимость, и когда означает?
Корреляция Пирсона измеряет только линейную часть связи. Если Y равен X в квадрате, а X симметричен относительно нуля, пара сильно зависима, но корреляция равна нулю. Нулевая корреляция влечёт независимость только для совместно гауссовских величин.
Типичные ошибки
- ✗Читать нулевой коэффициент корреляции как доказательство независимости
- ✗Забывать, что импликация верна только при совместной нормальности
- ✗Считать, что ранговый коэффициент ловит любую зависимость, а не только монотонную
Уточняющие вопросы
- →Что поймает ранговый коэффициент
Spearman's rho, чего не видит Пирсон? - →Каким тестом вы стали бы искать немонотонную зависимость?
JuniorТеорияЧастоЧем ковариация отличается от корреляции, и когда брать Spearman или Kendall?
Чем ковариация отличается от корреляции, и когда брать Spearman или Kendall?
Ковариация несёт единицы обеих величин, поэтому её размер нечитаем; корреляция масштабирует её в отрезок от минус единицы до единицы. Пирсон линеен и чувствителен к выбросам; Spearman и Kendall работают на рангах, устойчивы к выбросам и ловят монотонность.
Типичные ошибки
- ✗Сравнивать сырые ковариации у признаков с разными единицами
- ✗Применять Пирсона к тяжёлым хвостам, где коэффициент задают пара выбросов
- ✗Ждать от рангового коэффициента немонотонной связи
Уточняющие вопросы
- →Чем ранговый коэффициент
Kendall's tauотличается от Spearman на практике? - →Почему корреляция двух признаков важна до обучения линейной модели?
JuniorТеорияЧастоНа скошенных данных о зарплатах вы отчитываетесь бизнесу средним или медианой?
На скошенных данных о зарплатах вы отчитываетесь бизнесу средним или медианой?
Отчитывайтесь медианой. Зарплаты скошены вправо, и несколько высоких выплат тянут среднее выше заработка типичного сотрудника, а медиана отмечает середину. Среднее нужно, когда важна сумма — оно на численность даёт фонд оплаты.
Типичные ошибки
- ✗Приводить среднее по скошенным вправо данным как типичное значение
- ✗Считать, что ЦПТ делает само распределение зарплат симметричным
- ✗Полагать, что при правой скошенности медиана выше среднего
Уточняющие вопросы
- →Какую устойчивую меру разброса вы дадите вместе с медианой и почему?
- →Когда усечённое среднее — лучший компромисс, чем среднее или медиана?
JuniorТеорияЧастоЧем различаются дисперсия, стандартное отклонение и стандартная ошибка при росте данных?
Чем различаются дисперсия, стандартное отклонение и стандартная ошибка при росте данных?
Дисперсия — среднее квадратов отклонений; стандартное отклонение — её корень в единицах данных. Обе оценивают фиксированные свойства популяции и с ростом данных не убывают. Стандартная ошибка — это отклонение среднего, сигма на корень из n, и она падает.
Типичные ошибки
- ✗Ждать, что стандартное отклонение уменьшится с ростом выборки
- ✗Использовать стандартное отклонение и стандартную ошибку на графике как синонимы
- ✗Путать, какая из величин несёт единицы самих данных
Уточняющие вопросы
- →Какую из двух величин рисуют усами вокруг оценки среднего и почему?
- →Как стандартная ошибка связана с шириной доверительного интервала?
JuniorТеорияИногдаЧто такое p-value, и назовите три вещи, которых p = 0.03 не означает.
Что такое p-value, и назовите три вещи, которых p = 0.03 не означает.
p-value — это вероятность данных не менее экстремальных, чем ваши, если нулевая гипотеза верна. p = 0.03 не означает 3% шанс её истинности, не означает 97% шанс реальности эффекта и ничего не говорит о размере эффекта.
Типичные ошибки
- ✗Переворачивать условную вероятность и читать p как вероятность нулевой гипотезы
- ✗Считать малый p доказательством большого или ценного эффекта
- ✗Читать p как долю успешных повторов эксперимента
Уточняющие вопросы
- →Почему подглядывание в идущий эксперимент раздувает долю ложных срабатываний?
- →Что даёт доверительный интервал сверх того, что даёт один только p-value?
MiddleТеорияИногдаПри базовой частоте 1% и точности теста 95% чему равна P(болен при положительном)?
При базовой частоте 1% и точности теста 95% чему равна P(болен при положительном)?
Примерно 16%. Из 10 000 человек 100 больны, и 95 дадут положительный тест; из 9 900 здоровых положительными окажутся ещё 495. Итого 95 настоящих из 590. Интуиция игнорирует базовую частоту — 5% ошибок здоровой группы заглушают истинные срабатывания.
Типичные ошибки
- ✗Читать точность теста как вероятность того, что положительный результат верен
- ✗Отбрасывать базовую частоту, как только получен индивидуальный результат
- ✗Забывать, что большая здоровая группа даёт основную массу ложных срабатываний
Уточняющие вопросы
- →Как эта арифметика объясняет падение precision на редком положительном классе?
- →Что станет с ответом, если поднять специфичность до 99% при той же базовой частоте?
MiddleТеорияИногдаКак maximum a posteriori (MAP) расширяет MLE и какой prior даёт L2, а какой L1?
Как maximum a posteriori (MAP) расширяет MLE и какой prior даёт L2, а какой L1?
MLE максимизирует правдоподобие; MAP добавляет prior на веса и максимизирует апостериор. Логарифм превращает prior в аддитивный штраф — гауссовский prior с нулевым средним даёт L2 как в ridge, а prior Лапласа даёт L1 как в lasso, обнуляющий веса.
Типичные ошибки
- ✗Менять приоры местами, приписывая разреженность гауссовскому
- ✗Считать, что MAP отбрасывает правдоподобие, а не взвешивает его prior-ом
- ✗Упускать, что именно логарифм превращает prior в аддитивный штраф
Уточняющие вопросы
- →Как дисперсия prior отображается в силу регуляризации lambda?
- →Почему разреживающий штраф
L1загоняет веса ровно в ноль?
SeniorТеорияИногдаЧем 95% доверительный интервал отличается от 95% credible interval?
Чем 95% доверительный интервал отличается от 95% credible interval?
Доверительный интервал — утверждение о процедуре, где 95% построенных так интервалов накрывают фиксированный неизвестный параметр. Credible interval считает параметр случайным и помещает внутрь 95% апостериорной вероятности. Байес выигрывает на малых выборках.
Типичные ошибки
- ✗Формулировать частотный интервал как вероятность для параметра
- ✗Считать, что prior не влияет на границы credible interval
- ✗Ждать, что байесовская рамка важнее всего при изобилии данных
Уточняющие вопросы
- →Где в ML-системе апостериорное распределение однозначно лучше точечной оценки?
- →Как слабый prior меняет credible interval по мере роста выборки?
SeniorТеорияИногдаЧем закон больших чисел отличается от ЦПТ применительно к оценке Монте-Карло?
Чем закон больших чисел отличается от ЦПТ применительно к оценке Монте-Карло?
Закон больших чисел говорит, что выборочное среднее сходится к истинному ожиданию — он обосновывает состоятельность оценки Монте-Карло, но не величину промаха. ЦПТ даёт масштаб и форму ошибки, нормальную с сигмой на корень из n, откуда и берутся доверительные усы.
Типичные ошибки
- ✗Считать обе теоремы взаимозаменяемыми утверждениями
- ✗Полагать, что ошибка Монте-Карло убывает линейно, а не как корень из n
- ✗Игнорировать, что обоим результатам нужна конечная дисперсия
Уточняющие вопросы
- →Сколько дополнительных выборок покупают ещё один десятичный знак точности?
- →Какой приём снижения дисперсии вы примените до простого наращивания выборок?
SeniorТеорияИногдаПочему минимизация MSE — это MLE при гауссовском шуме, а log-loss — при Bernoulli-метке?
Почему минимизация MSE — это MLE при гауссовском шуме, а log-loss — при Bernoulli-метке?
Выпишите отрицательное логарифмическое правдоподобие. Если цель равна выходу модели плюс гауссовский шум с нулевым средним и фиксированной дисперсией, показатель экспоненты и есть квадрат ошибки, то есть МНК. При Bernoulli-метке тот же вывод даёт cross-entropy.
Типичные ошибки
- ✗Считать MSE и cross-entropy произвольным выбором, а не следствием модели шума
- ✗Менять местами, какая модель шума порождает какую функцию потерь
- ✗Полагать, что максимальное правдоподобие применимо только к генеративным моделям
Уточняющие вопросы
- →Какая функция потерь следует из тяжелохвостого шума Лапласа вместо гауссовского?
- →Как этот взгляд объясняет обучение счётной цели с Poisson-функцией потерь?
SeniorТеорияРедкоКак каждый сегмент может улучшиться, а сводная метрика упасть, и что это значит для A/B-отчётности?
Как каждый сегмент может улучшиться, а сводная метрика упасть, и что это значит для A/B-отчётности?
Парадокс Симпсона — смешивающий фактор сдвигает состав сегментов. Если вариант шлёт больше трафика в слабый сегмент, каждый сегмент может вырасти, а сводная метрика упасть, ведь сводное число взвешено по составу. Показывайте и состав трафика.
Типичные ошибки
- ✗Считать сводную конверсию невзвешенным средним сегментных
- ✗Винить шум или множественные сравнения вместо сдвига состава сегментов
- ✗Показывать только сводную метрику без картины состава трафика
Уточняющие вопросы
- →Какая ошибка рандомизации чаще всего позволяет составу сегментов разъехаться между ветками?
- →Как заранее зафиксированный план сегментации снижает риск такого разворота?