Линейные модели и оптимизация
Линейная модель предсказывает взвешенную сумму признаков — гиперплоскость в пространстве. Она проста, но именно на ней держатся все базовые интуиции ML: что такое функция потерь, как её минимизировать, что такое переобучение и как его сдерживать регуляризацией. Разберётесь здесь — половина вопросов про сложные модели станет очевидной.
Две главные ловушки темы. Первая — думать, что линейную регрессию в проде решают аналитической формулой: на деле почти всегда работает градиентный спуск, потому что обращение матрицы стоит O(n³) и неустойчиво. Вторая — считать L1 и L2 «одним и тем же с разным масштабом»: L1 обнуляет веса и даёт разреженность, L2 лишь уменьшает их. Полная карта — в слоях ниже.
Карта темы
- Линейная регрессия — гиперплоскость, квадратичная потеря и то, как задачу решают на практике.
- Аналитическая формула МНК — решение
w = (XᵀX)⁻¹Xᵀy, его стоимость и почему его избегают. - Регуляризация — штраф за норму весов против переобучения и почему bias в него не включают.
- L1 и L2 — почему L1 даёт разреженность, а L2 нет, и что такое Elastic Net.
- Градиентный спуск — полный GD против стохастического SGD и как выбирают между ними.
- Модификации GD — momentum, AdaGrad, RMSProp, Adam и чем они отличаются.
- SGD с momentum — накопление градиентов против зигзага на плохо обусловленных линиях уровня.
Частые ошибки и ловушки
| Ошибка | Последствие |
|---|---|
| Считать, что в проде применяют аналитическую формулу МНК | Игнорируется стоимость O(n³) и неустойчивость при вырожденной XᵀX |
Называть сложность обращения матрицы O(n²) | Путают число элементов с числом операций — на деле O(n³) |
| Считать L1 и L2 отличающимися лишь масштабом | Упускается, что разреженность даёт только L1 |
| Штрафовать свободный член (intercept) | Гиперплоскость нельзя сдвинуть к данным, качество падает |
| Думать, что штраф улучшает подгонку на обучении | Наоборот — штраф сдерживает подгонку ради обобщения |
| Путать оптимизаторы с регуляризацией | Adam/RMSProp меняют шаг, а не штрафуют веса |
| Описывать momentum как фиксированное направление | Это затухающее скользящее среднее градиентов, а не один вектор |
Значение для собеседований
Линейные модели любят на собеседованиях именно потому, что здесь негде спрятаться: формула МНК, геометрия L1/L2 и механика градиентного спуска либо поняты, либо нет. Кандидат, который выводит разреженность L1 из постоянного градиента штрафа, а не из заученной картинки с ромбом, сразу выглядит сильнее.
Что обычно проверяют:
- Как на практике решают линейную регрессию и почему не аналитической формулой.
- Формулу МНК, сложность обращения матрицы
O(n³)и рольλI. - Зачем нужна регуляризация и почему intercept из штрафа исключают.
- Откуда у L1 разреженность (геометрия ромба + постоянный градиент), а у L2 её нет.
- Семейство оптимизаторов и что именно даёт momentum поверх SGD.
Типичный неверный ответ: «в продакшене решают через (XᵀX)⁻¹, а L1 и L2 — одно и то же». На деле формулу избегают из-за стоимости и неустойчивости, а разреженность даёт только L1 — L2 веса лишь уменьшает, но до нуля не доводит.