Метрики качества
Метрика отвечает на вопрос «насколько хороша модель», но правильный ответ зависит от задачи. Precision и recall смотрят на положительный класс с разных сторон, accuracy смешивает всё и врёт при дисбалансе, AUC-ROC измеряет качество ранжирования и не зависит от порога, а метрики регрессии по-разному реагируют на выбросы.
Тема кажется школьной, но ловушек в ней много. Accuracy на дисбалансе бесполезна. AUC-ROC — это доля верно упорядоченных пар, а не accuracy при пороге 0.5, и высокий AUC не гарантирует чистый топ-K. При выбросах MSE тянет подгонку к аномалиям. Полная карта — в слоях ниже.
Карта темы
- Метрики классификации — precision, recall, accuracy, их формулы через TP/FP/FN/TN и почему accuracy обманывает.
- Компромисс precision/recall — как порог сдвигает баланс и как выбирать его под цену ошибки.
- AUC-ROC — площадь под ROC-кривой, ранговая интерпретация, инвариантность к ресэмплингу и разрыв с precision@K.
- Метрики регрессии — MAE, MSE, RMSE и Huber, устойчивость к выбросам и цена недифференцируемости MAE.
Частые ошибки и ловушки
| Ошибка | Последствие |
|---|---|
| Менять местами знаменатели precision и recall | FP против FN перепутаны — метрики посчитаны неверно |
| Сообщать accuracy на несбалансированной выборке | Модель, всегда предсказывающая большинство, кажется «хорошей» |
| Путать AUC-ROC с accuracy при пороге 0.5 | AUC — про ранжирование, а не про одну рабочую точку |
| Считать, что высокий AUC гарантирует чистый топ-K | При дисбалансе весь топ-K может оказаться отрицательным |
| Выбирать MSE при выбросах | Несколько аномалий доминируют в лоссе и тянут подгонку к себе |
| Смешивать русское «точность» с accuracy | «Точность» здесь — это precision, а не доля правильных |
Значение для собеседований
Метрики — фильтр на здравый смысл. Кандидат, который сам оговаривает «accuracy на дисбалансе врёт, поэтому смотрю precision/recall или AUC», сразу выделяется на фоне «ну, точность 95 процентов, значит хорошо».
Что обычно проверяют:
- Формулы precision, recall, accuracy и когда accuracy обманчива.
- Что порог сдвигает баланс precision и recall — и как выбрать его под задачу.
- Что такое AUC-ROC и почему это ранговая, а не пороговая метрика.
- MAE против MSE при выбросах и зачем нужен Huber loss.
Типичный неверный ответ: «AUC-ROC — это доля верно классифицированных объектов». На самом деле AUC — это вероятность, что случайный положительный объект окажется выше случайного отрицательного, то есть доля верно упорядоченных пар, и она не зависит от порога.