«Почему ROC AUC не идеальная метрика для медицины» 🩺📊
Когда я впервые узнала про ROC AUC, она показалась почти идеальной метрикой. Красивая, понятная, универсальная, часто видела ее в соревнованиях… Но чем больше я погружаюсь в медицинские кейсы, тем больше понимаю: не всё так просто.
📌 Что вообще показывает ROC AUC? Если коротко- насколько хорошо модель умеет отличать один класс от другого (например, больных от здоровых). Звучит отлично. Но есть проблема 👇
⚠️ Проблема №1 она не учитывает дисбаланс классов В медицине часто бывает так: 95% здоровые 5% больные И модель может показывать высокий ROC AUC… но при этом плохо находить именно больных пациентов.
⚠️ Проблема №2 она не отражает клиническую ценность ROC AUC не отвечает на главный вопрос врача: 👉 «Сколько больных мы действительно нашли?»
Потому что ошибка - это не просто число, а реальный пациент.
⚠️ Проблема №3 - одинаковые ROC AUC это не одинаковые модели Две модели могут иметь одинаковый ROC-AUC, но при этом: одна находит почти всех больных другая пропускает половину С точки зрения медицины - это огромная разница!
💡 Что тогда использовать? sensitivity specificity precision / recall
📌 Мой вывод: ROC AUC полезная метрика, но использовать её в одиночку в медицине не целесообразно.