Классический ML и бустинг
До трансформеров — и до сих пор на табличных данных — рабочая лошадка это дерево решений и ансамбль из них. Эта тема строит модель мышления, которую проверяет интервьюер: как одиночное дерево выбирает разбиение и почему переобучается, как градиентный бустинг складывает слабые деревья в самую сильную табличную модель, и как методы без учителя находят структуру, когда меток нет вовсе. Глубокое обучение выигрывает на тексте и картинках; на таблице признаков обычно всё равно побеждает градиентный бустинг деревьев.
Три слоя ниже идут от одного дерева к библиотеке бустинга и к обучению без цели. По пути мы называем ловушки, которые отличают уверенный ответ от заученного: одиночное дерево экстраполирует полкой, бустинг подгоняет негативный градиент — а не сырые данные — по одному дереву за шаг, а картинка t-SNE нужна глазу, но никогда не модели.
Карта темы
- Деревья решений — как узел разбивается по impurity (Gini/entropy), почему неограниченное дерево запоминает данные, обрезка и глубина, и почему impurity-важность признаков смещена к колонкам высокой кардинальности.
- Бустинг-библиотеки — градиентный бустинг как последовательная подгонка негативного градиента, XGBoost против LightGBM против CatBoost (level-wise против leaf-wise, нативные категории) и гиперпараметры, управляющие переобучением.
- Обучение без учителя — k-means и его допущение о сферах, DBSCAN и иерархическая кластеризация, направления максимальной дисперсии PCA и почему t-SNE/UMAP — только для визуализации.
Значение для собеседований
Классический ML проверяет вашу модель, а не знание API. Кандидат, который говорит «бустинг подгоняет каждое дерево к остатку предыдущего, последовательно», сразу опережает того, кто говорит «он усредняет много деревьев». Что спрашивают постоянно: какую impurity минимизирует разбиение, какие ручки не дают дереву запомнить данные, почему leaf-wise рост переобучается на малых данных и почему PCA и t-SNE не взаимозаменяемы.