Медицинские данные + Data Science: 5 ошибок, которые …
…я уже совершила 😅
Привет, сетка! Я пропала на время, а все потому, что закрывала экзамен по математике в ML, работала над итоговым проектом, а потом и вовсе заболела. Было тяжело, но теперь я снова в строю🙌🏻
Хочу поделиться своими наблюдениями об ошибках при работе с медицинскими данными. Здесь важна каждая из них, ведь это отражается не только на модели, но и на понимании состояния пациента.
🩻 Игнорирование клинического контекста Без понимания, что означают показатели, можно создать красивую модель, которая ничего не решает. Моя ошибка на старте: смотрела только на метрики, не понимая, как врачи могут использовать на практике эти данные.
🧪 Пропуски и выбросы В медицине пропуски и редкие значения, зачастую не баги, а критическая информация о пациентах. Простейшая замена на среднее или удаление выбросов может “сломать” результат.
🧬 Data leakage Использование признаков, которые появляются после события (к примеру, диагноз), даёт отличные метрики, но полностью уничтожает модель, она становится бесполезна.
🔬 Метрики vs. реальная ценность Accuracy 95% звучит здорово, но при несбалансированных классах это почти ничего не значит. Я теперь смотрю на recall, precision и ROC-AUC в зависимости от задачи.
🪬Этика и приватность Медицинские данные требуют уважения: анонимность и безопасность.