Линейные модели и оптимизация
Линейная регрессия, регуляризация (L1/L2/Elastic Net), аналитическое решение МНК и его подводные камни, градиентные методы оптимизации.
18 вопросов
JuniorТеорияОчень частоКакие допущения делает линейная регрессия и какое из них обесценивает её p-значения?
Какие допущения делает линейная регрессия и какое из них обесценивает её p-значения?
Линейность по параметрам, независимость ошибок, постоянная дисперсия, нормальные остатки. Гетероскедастичность или коррелированные ошибки не смещают коэффициенты, но ломают формулу стандартных ошибок, и p-значения неверны.
Типичные ошибки
- ✗Требуют нормальности самих признаков вместо остатков
- ✗Считают все допущения одинаково критичными и для прогноза, и для вывода
- ✗Не знают, что робастные стандартные ошибки чинят вывод при гетероскедастичности
Уточняющие вопросы
- →Почему центральная предельная теорема делает допущение нормальности мягким на больших выборках?
- →Какое допущение первым ломается на временных рядах и что это делает с выводом?
JuniorТеорияОчень частоКак трактуется один коэффициент регрессии и когда такая трактовка ломается?
Как трактуется один коэффициент регрессии и когда такая трактовка ломается?
Коэффициент это ожидаемое изменение цели при росте признака на единицу при фиксированных остальных. Коррелированные признаки делают оговорку ненаблюдаемой и расшатывают знаки, а разные шкалы делают величины несравнимыми, нужна стандартизация.
Типичные ошибки
- ✗Читают коэффициент как причинный эффект, а не условную связь
- ✗Ранжируют важность признаков по сырой величине коэффициента в разных единицах
- ✗Обучают Ridge или Lasso на немасштабированных колонках, и штраф ложится неравномерно
Уточняющие вопросы
- →Почему штраф на немасштабированных колонках сильнее всего бьёт по признакам малого масштаба?
- →О чём говорит раздутая дисперсия коэффициента для пары коррелированных колонок?
JuniorТеорияОчень частоПочему бинарную метку моделируют логистической регрессией, а не линейной?
Почему бинарную метку моделируют логистической регрессией, а не линейной?
Линейная подгонка не ограничена, поэтому даёт вероятности меньше нуля или больше единицы и перекашивается далёкими точками. Логистическая регрессия сжимает счёт через sigmoid в модель логарифма шансов и учится на выпуклой log-loss.
Типичные ошибки
- ✗Читают сырой линейный счёт как вероятность без всякого ограничения
- ✗Считают, что log-loss выбран для удобства, а не ради выпуклости
- ✗Полагают, что квадратичная ошибка поверх sigmoid обучается так же хорошо
Уточняющие вопросы
- →Что предсказывает линейная часть модели в шкале логарифма шансов?
- →Почему квадратичная ошибка поверх sigmoid обнуляет градиент при уверенно неверном предсказании?
JuniorТеорияЧастоКакие модификации градиентного спуска ты знаешь?
Какие модификации градиентного спуска ты знаешь?
Варианты: SGD с momentum (накапливает прошлые градиенты), AdaGrad (свой шаг на параметр), RMSProp (AdaGrad со скользящим средним против затухания шага), Adam (momentum + RMSProp) и Adan. Различаются способом адаптации шага и сглаживания направления градиента.
Типичные ошибки
- ✗Путают варианты оптимизатора с приёмами регуляризации
- ✗Думают, что Adam не связан с momentum и RMSProp, а не объединяет их
- ✗Считают RMSProp и AdaGrad несвязанными, хотя RMSProp уточняет AdaGrad
Уточняющие вопросы
- →Что momentum добавляет к обычному SGD?
- →Почему RMSProp устраняет проблему затухающего шага AdaGrad?
JuniorТеорияЧастоКак на практике обычно решают задачу линейной регрессии?
Как на практике обычно решают задачу линейной регрессии?
Градиентными методами, а не аналитической матричной формулой. Основные варианты — полный градиентный спуск (GD), берущий все объекты на шаге, и стохастический (SGD), берущий один объект или мини-батч. SGD масштабируется на большие данные и стоит по умолчанию.
Типичные ошибки
- ✗Считают, что в продакшене реально применяют аналитическую формулу
- ✗Не различают полный GD и стохастический/мини-батчевый SGD
- ✗Думают, что SGD — лишь приближение на случай, когда GD недоступен
Уточняющие вопросы
- →Почему аналитическое решение избегают, хотя оно точное?
- →Когда мини-батчевый SGD предпочтительнее полного GD?
JuniorТеорияЧастоЧто именно наивного в наивном байесовском классификаторе и почему он работает на тексте?
Что именно наивного в наивном байесовском классификаторе и почему он работает на тексте?
Он предполагает условную независимость признаков при известном классе, чего у слов нет. Он выживает потому, что классификации нужен лишь верный argmax, а не откалиброванные вероятности — коррелированные слова похоже поднимают счёт всех классов.
Типичные ошибки
- ✗Думают, что наивность про априор класса, а не про независимость признаков
- ✗Ожидают, что его выходные вероятности хорошо откалиброваны
- ✗Заключают, что ложное допущение обязательно делает классификатор бесполезным
Уточняющие вопросы
- →Почему плохо откалиброванный счёт всё же даёт верное решение о классе?
- →Что чинит аддитивное сглаживание, когда слово не встречалось в одном из классов?
JuniorТеорияЧастоЧто такое регуляризация и какие её виды применимы к линейным моделям?
Что такое регуляризация и какие её виды применимы к линейным моделям?
Регуляризация борется с переобучением, добавляя в функционал штраф за норму весов. Для линейных моделей это L1 (сумма модулей весов), L2 (сумма квадратов) и Elastic Net (комбинация L1 и L2). Штраф не даёт весам расти слишком большими.
Типичные ошибки
- ✗Путают регуляризацию (штрафной член) с масштабированием или отбором признаков
- ✗Думают, что L1 и L2 отличаются только масштабом, а не влиянием на разреженность
- ✗Считают Elastic Net отдельным алгоритмом, а не взвешенной суммой штрафов L1 и L2
Уточняющие вопросы
- →Какой из штрафов, L1 или L2, обнуляет веса и почему?
- →Нужно ли включать в штраф свободный член (intercept)?
JuniorТеорияЧастоКак читать график остатков и о чём говорят форма воронки и заметный изгиб?
Как читать график остатков и о чём говорят форма воронки и заметный изгиб?
Остатки строят против предсказанных значений — здоровая картина это бесформенная полоса вокруг нуля. Воронка означает рост дисперсии ошибки с прогнозом, тогда преобразуют цель или берут робастные ошибки. Изгиб означает неверную форму.
Типичные ошибки
- ✗Строят остатки против цели, а не против предсказанных значений
- ✗Читают воронку как признак нехватки признаков, а не неравной дисперсии
- ✗Игнорируют изгиб, потому что общая метрика ошибки всё ещё выглядит приемлемо
Уточняющие вопросы
- →Какое именно допущение опровергает форма воронки?
- →Почему логарифмирование цели часто выравнивает воронку?
MiddleТеорияЧастоЧто учит порождающая модель против различающей и кто выигрывает на крошечных данных?
Что учит порождающая модель против различающей и кто выигрывает на крошечных данных?
Порождающая модель учит совместное распределение — априор класса и признаки в классе — и выводит апостериор. Различающая подгоняет границу напрямую. Наивный байес раньше достигает своей асимптотической ошибки и лидирует на малых данных.
Типичные ошибки
- ✗Меняют определения местами и называют порождающей модель, учащую границу
- ✗Полагают, что победитель на малой выборке победит и на большой
- ✗Считают, что порождающая модель обязана синтезировать реалистичные входы
Уточняющие вопросы
- →Какую из двух вы возьмёте, когда размеченных данных станет много, и почему?
- →Что дополнительно умеет порождающая модель, чего не может модель границы?
MiddleТеорияЧастоКакова аналитическая формула МНК и почему её избегают на практике?
Какова аналитическая формула МНК и почему её избегают на практике?
Минимизация квадрата ошибки даёт w = (XᵀX)⁻¹Xᵀy. Её избегают, потому что обращение XᵀX дорого при многих признаках, а XᵀX бывает вырожденной или плохо обусловленной — инверсия невозможна или неустойчива. Добавление λI чинит обусловленность; предпочитают градиентные методы.
Типичные ошибки
- ✗Неверно вспоминают формулу (не там транспонирование или обратная матрица)
- ✗Называют только стоимость обращения, забывая о вырожденности/плохой обусловленности
- ✗Не знают, что регуляризация восстанавливает обратимость через
λI
Уточняющие вопросы
- →Какова вычислительная сложность входящего сюда обращения матрицы?
- →Как именно добавление
λIделаетXᵀXобратимой?
MiddleТеорияЧастоПочему штраф за норму весов помогает бороться с переобучением?
Почему штраф за норму весов помогает бороться с переобучением?
Симптом переобучения — очень большие веса. При огромных весах два почти одинаковых объекта, отличающихся на эпсилон, могут давать сильно разные предсказания — функция неустойчива. Штраф за норму уменьшает веса к нулю, делая функцию более гладкой и устойчивой, и она лучше обобщает.
Типичные ошибки
- ✗Думают, что штраф улучшает подгонку на обучении, а не сдерживает её
- ✗Не связывают большие веса с гиперчувствительностью выхода к близким входам
- ✗Считают, что помогает любое уменьшение весов, забывая, что цель — более гладкая функция
Уточняющие вопросы
- →Какой именно симптом переобучения нейтрализует штраф?
- →Увеличивает ли уменьшение весов смещение и приемлем ли такой обмен?
MiddleТеорияЧастоЧто такое SGD с momentum и когда он ускоряет сходимость?
Что такое SGD с momentum и когда он ускоряет сходимость?
Momentum хранит экспоненциально взвешенную сумму последних градиентов и шагает вдоль неё, гася колебания. Сильнее всего помогает на вытянутых (плохо обусловленных) линиях уровня: градиент направлен поперёк узкого оврага, обычный SGD зигзагует, а momentum усредняет боковые колебания и идёт вдоль дна оврага.
Типичные ошибки
- ✗Описывают momentum как фиксированное направление, а не затухающее скользящее среднее
- ✗Не называют вытянутые/плохо обусловленные линии уровня как случай наибольшей пользы
- ✗Путают гашение колебаний с простым увеличением learning rate
Уточняющие вопросы
- →Почему градиент перпендикулярен линиям уровня и почему это вызывает зигзаг?
- →Как Adam развивает идею momentum?
SeniorТеорияЧастоПочему L1-регуляризация даёт разреженные веса, а L2 — нет?
Почему L1-регуляризация даёт разреженные веса, а L2 — нет?
Геометрически ограничение L1 — ромб с углами на осях; линия уровня ошибки обычно касается его именно в углу, где вес равен 0. Ограничение L2 — круг без углов. По градиенту: у L1 |∂R/∂w| постоянна, и спуск доходит до 0; у L2 она убывает при w→0, и вес не доходит до нуля.
Типичные ошибки
- ✗Путают фигуры — называют L1 кругом, а L2 ромбом
- ✗Объясняют только геометрию, упуская довод о постоянном против убывающего градиенте
- ✗Утверждают, что L2 тоже обнуляет веса, просто медленнее
Уточняющие вопросы
- →Что верно про градиенты ошибки и штрафа в углу ромба?
- →Почему функционал L1 недифференцируем на осях и мешает ли это спуску?
JuniorТеорияИногдаЧто такое зазор и опорные векторы в методе опорных векторов и что регулирует C?
Что такое зазор и опорные векторы в методе опорных векторов и что регулирует C?
Зазор это полоса между гиперплоскостью и ближайшими точками, обучение максимизирует её ширину. Опорные векторы это точки на ней или нарушающие её — только они определяют решение. Большое C сужает зазор, малое расширяет.
Типичные ошибки
- ✗Считают опорным вектором каждую обучающую точку
- ✗Читают большое C как усиление регуляризации, а не ослабление
- ✗Путают зазор с расстоянием между центроидами классов
Уточняющие вопросы
- →Почему удаление точки, не являющейся опорной, не меняет найденную границу?
- →Какое значение C вы возьмёте, если обучающие данные шумные?
MiddleДебаггингИногдаПочему на разделимых данных коэффициенты логистической регрессии улетают и что это чинит?
Почему на разделимых данных коэффициенты логистической регрессии улетают и что это чинит?
При идеальной разделимости оптимум максимального правдоподобия не существует: рост весов толкает log-loss к нулю, не достигая его, поэтому коэффициенты расходятся, а солвер встаёт лишь по лимиту итераций. Штраф фиксирует конечное решение.
Открыть задачу →Типичные ошибки
- ✗Поднимают max_iter и считают исчезнувшее предупреждение решением
- ✗Винят переполнение float или масштаб признаков вместо несуществующего оптимума
- ✗Считают, что идеальная точность на обучении означает здоровую модель
Уточняющие вопросы
- →Почему поднятие лимита итераций делает напечатанные коэффициенты больше, а не устойчивее?
- →Какое ещё средство, кроме штрафа, ограничивает оценку при разделимости?
MiddleТеорияИногдаНужно ли включать свободный член (intercept) в регуляризатор?
Нужно ли включать свободный член (intercept) в регуляризатор?
Нет. Свободный член лишь сдвигает гиперплоскость туда, где лежат данные; это не вес признака. Штраф тянет сдвиг к нулю и мешает верно расположить гиперплоскость, из-за чего качество падает. По соглашению bias из штрафа исключают.
Типичные ошибки
- ✗Относятся к свободному члену как к обычному весу, который надо уменьшать
- ✗Не понимают, что bias позиционирует гиперплоскость, а не масштабирует признак
- ✗Считают включение w0 безвредным, хотя оно обычно ухудшает качество
Уточняющие вопросы
- →Что геометрически контролирует bias, чего не делают веса признаков?
- →Как библиотеки обычно реализуют это исключение на практике?
SeniorТеорияРедкоКакова вычислительная сложность обращения матрицы n×n?
Какова вычислительная сложность обращения матрицы n×n?
Стандартный алгоритм (Гаусс–Жордан / LU) кубический, O(n³). Быстрое умножение по Штрассену снижает до примерно O(n^2.81), есть и асимптотически более быстрые алгоритмы, но с огромными константами и практическими ограничениями, поэтому их почти не применяют. Эта кубическая стоимость — причина избегать формулы МНК.
Типичные ошибки
- ✗Называют сложность
O(n²), считая элементы, а не операции - ✗Думают, что быстрые алгоритмы вроде Штрассена применяются по умолчанию в библиотеках
- ✗Путают стоимость одного умножения матрицы на вектор со стоимостью полного обращения
Уточняющие вопросы
- →Почему субкубические алгоритмы не применяют по умолчанию, несмотря на лучшую асимптотику?
- →Как эта стоимость мотивирует градиентные методы при больших признаковых пространствах?