Основы ML
Перед любой моделью есть слой рассуждений, который решает, значат ли что-нибудь её числа: вероятность, порождающая данные, дисциплина, удерживающая метрику честной, и арифметика редкого положительного класса. Модель может идеально обучиться и всё равно быть бесполезной, если метрика, которой вы доверяете, раздута утечкой или измеряет мажоритарный класс вместо того, что вам нужно. Эта тема — фундамент, на котором стоит остальной ML.
Сквозная линия всех трёх слоёв — один и тот же рефлекс на собеседовании: сначала назовите, что измеряет число, а потом доверяйте ему.
Карта темы
- Вероятность и статистика — распределения и что они моделируют, математическое ожидание и дисперсия, Байес и базовые частоты, MLE против MAP, и что на самом деле утверждают (и чего никогда не утверждают) p-value и доверительный интервал.
- Обобщение — смещение против разброса, переобучение против недообучения, честные split'ы train/val/test, схемы кросс-валидации, регуляризация, кривые обучения и утечка, тихо раздувающая любую метрику.
- Дисбаланс классов — почему accuracy врёт на редких классах, precision/recall/F1, PR-AUC против ROC-AUC, ресемплинг и веса классов и их риски, выбор порога и калибровка.
Что проверяют на собеседовании
Общая нить — опровергнуть уверенное неверное прочтение: p-value не есть вероятность истинности нулевой гипотезы; высокая метрика на валидации нечестна, если трансформация обучена до split'а; accuracy 99.9% не мастерство, когда базовая частота 0.1%. Разберитесь в этих трёх основах — и любой дальнейший разговор о модели станет проще.