Что показывает ROC-AUC и когда эта метрика может вводить в заблуждение?
Короткий ответ
- ROC-кривая: TPR против FPR при всех порогах
- AUC — вероятность, что позитив получит скор выше негатива
- 0.5 — случайный классификатор, 1.0 — идеальный
- Не зависит от выбранного порога классификации
- При сильном дисбалансе завышает впечатление о качестве
- Тогда информативнее PR-AUC по положительному классу
- Не показывает калибровку предсказанных вероятностей
ROC-AUC измеряет качество ранжирования позитивов над негативами по всем порогам, но при сильном дисбалансе классов надёжнее смотреть PR-AUC.
Как сказать вслух
пример ответаROC-AUC показывает, насколько хорошо модель ранжирует: это вероятность, что случайный позитивный объект получит оценку выше случайного негативного. Ноль пять — это монетка, единица — идеал. Подвох в том, что при редком положительном классе AUC может выглядеть отлично, хотя точность положительных предсказаний низкая, и тогда честнее смотреть на precision-recall кривую.
Подробный ответ
Основной ответ
ROC-кривая строится по всем порогам в координатах TPR (recall) против FPR, а AUC — площадь под ней. Вероятностная интерпретация: AUC равен вероятности того, что случайно взятый положительный объект получит скор выше случайно взятого отрицательного, то есть это метрика качества ранжирования, не зависящая от порога. Проблемы: при сильном дисбалансе FPR почти не растёт из-за огромного числа негативов, поэтому AUC остаётся высоким даже при плохом precision — здесь показательнее PR-AUC. Кроме того, AUC ничего не говорит о калибровке вероятностей и об абсолютном качестве на рабочем пороге, а сравнение моделей по AUC не гарантирует лучшую модель в рабочей точке.
Ключевые моменты
- Интерпретация через ранжирование. AUC — вероятность верного попарного упорядочивания позитива и негатива; эквивалент статистики Манна-Уитни.
- Дисбаланс. Чем реже позитивный класс, тем оптимистичнее выглядит ROC-AUC; PR-кривая чувствительнее к ошибкам на позитивах.
- Калибровка отдельно. Модель с отличным AUC может выдавать несмещённые ранги, но плохие вероятности; для этого есть calibration curve и Brier score.
- Рабочая точка. Бизнес живёт на одном пороге, поэтому финальное решение принимают по метрикам в этой точке.
Практический контекст
Вопрос-фильтр на middle: назвать определение могут многие, а объяснить вероятностную интерпретацию и ограничения при дисбалансе — меньшинство. В работе выбор между ROC-AUC и PR-AUC возникает в антифроде, кредитном скоринге и медицине, где позитивов доли процента. Интервьюеру также понравится упоминание Gini = 2*AUC - 1, принятого в скоринге.
Частые ошибки
- Определяют AUC только как площадь под кривой без вероятностной интерпретации
- Не знают, что при дисбалансе ROC-AUC завышает впечатление и есть PR-AUC
- Считают, что высокий AUC означает хорошие калиброванные вероятности