ML — Вопросы для собеседований
A/B-тесты и эксперименты
Дизайн экспериментов, подглядывание, множественные сравнения, эффекты новизны и сети, switchback, CUPED, разрыв offline–online, OEC и A/A-тесты.
11 вопросов
ИИ-агенты и оценка LLM
LLM-as-judge и оценка, guardrails, prompt injection, вызов инструментов, цикл ReAct, галлюцинации и структурированный вывод.
11 вопросов
Градиентный бустинг на практике
Особенности реализаций XGBoost, LightGBM и CatBoost: стратегии роста деревьев, histogram-разбиения, GOSS/EFB, ordered target statistics, монотонные ограничения и гиперпараметры.
11 вопросов
Компьютерное зрение
Свёрточные и пулинговые слои, классические архитектуры CNN (Inception, residual-блоки ResNet), аугментация на инференсе.
20 вопросов
Деревья решений
Механика одиночного дерева: критерии разбиения, impurity, обрезка, пределы экстраполяции, смещение важности признаков и обработка пропусков без импутации.
9 вопросов
Обучение нейросетей
Регуляризация нейросетей, dropout на обучении и инференсе, нормализационные слои (BatchNorm/LayerNorm), накопление градиентов, архитектуры для множеств и графов.
21 вопросов
Ансамбли алгоритмов
Бэггинг и Random Forest, градиентный бустинг и реализации GBDT, влияние на смещение и разброс, подбор гиперпараметров, стекинг.
18 вопросов
Работа с признаками
Кодирование, масштабирование, импутация, выбросы, преобразования, отбор признаков, мультиколлинеарность и временные признаки без утечки будущего.
12 вопросов
Обобщение и валидация
Смещение и разброс, проклятие размерности, double descent, дисциплина train/validation/test, схемы кросс-валидации и четыре формы утечки данных.
11 вопросов
Несбалансированные данные
Стратегии при дисбалансе классов: ресемплинг, SMOTE, веса классов, выбор порога, выбор между классификацией и поиском аномалий и калибровка после ресемплинга.
8 вопросов
Архитектура LLM
Внутреннее устройство трансформеров для LLM: авторегрессионная генерация, KV-cache, MQA/GQA, RoPE, Mixture-of-Experts, обучение токенизатора и законы масштабирования.
10 вопросов
Инференс и обслуживание LLM
Квантизация, память KV-cache, спекулятивное декодирование, FlashAttention, continuous batching, стратегии декодирования, латентность против пропускной способности и стоимость обслуживания.
11 вопросов
Обучение и адаптация LLM
Fine-tuning против RAG и промптинга, LoRA/QLoRA, катастрофическое забывание, выравнивание SFT/RLHF/DPO, instruction tuning и стратегии промптинга.
11 вопросов
Линейные модели и оптимизация
Линейная регрессия, регуляризация (L1/L2/Elastic Net), аналитическое решение МНК и его подводные камни, градиентные методы оптимизации.
18 вопросов
MLOps и ML в продакшене
Training-serving skew, дрейф данных против дрейфа концепции, feature store, триггеры переобучения, воспроизводимость, реестры моделей и мониторинг в проде.
11 вопросов
Дизайн ML-систем
Сквозной дизайн систем рекомендаций, антифрода, ранжирования поиска, CTR, модерации, дедупликации, churn, чат-бота, матчинга и ETA — от метрики до стоимости обслуживания.
14 вопросов
Метрики качества
Точность, полнота и доля правильных ответов, компромисс порогов precision/recall, AUC-ROC и его ранговые свойства, метрики регрессии при выбросах.
17 вопросов
NLP и трансформеры
Эмбеддинги слов и текстов, encoder/decoder в трансформере, self-attention и позиционное кодирование, BERT для эмбеддингов и question answering.
18 вопросов
Теория вероятностей и статистика для ML
Метод максимального правдоподобия, теорема Байеса, корреляция и независимость, ЦПТ, p-value, распределения, доверительные интервалы и мощность/размер выборки.
14 вопросов
RAG (поиск + генерация)
Устройство RAG-пайплайна, стратегии чанкинга, гибридный поиск, векторные базы и HNSW, заземление/отказ и разделение качества поиска и генерации.
9 вопросов
Рекомендательные системы
Коллаборативная/контентная/гибридная фильтрация, матричная факторизация, cold start, генерация кандидатов и ранжирование, two-tower, NDCG, position bias и петли обратной связи.
11 вопросов
Прогнозирование временных рядов
Стационарность и тест ADF, ACF/PACF, rolling-origin бэктест, GBDT против ARIMA, многошаговый прогноз, сезонность и прерывистый спрос.
11 вопросов
Обучение без учителя
Кластеризация k-means и DBSCAN, PCA и LDA, t-SNE/UMAP и поиск аномалий на автоэнкодерах.
12 вопросов