Медицинские данные + Data Science: 5 ошибок, которые …

…я уже совершила 😅

Привет, сетка! Я пропала на время, а все потому, что закрывала экзамен по математике в ML, работала над итоговым проектом, а потом и вовсе заболела. Было тяжело, но теперь я снова в строю🙌🏻

Хочу поделиться своими наблюдениями об ошибках при работе с медицинскими данными. Здесь важна каждая из них, ведь это отражается не только на модели, но и на понимании состояния пациента.

🩻 Игнорирование клинического контекста Без понимания, что означают показатели, можно создать красивую модель, которая ничего не решает. Моя ошибка на старте: смотрела только на метрики, не понимая, как врачи могут использовать на практике эти данные.

🧪 Пропуски и выбросы В медицине пропуски и редкие значения, зачастую не баги, а критическая информация о пациентах. Простейшая замена на среднее или удаление выбросов может “сломать” результат.

🧬 Data leakage Использование признаков, которые появляются после события (к примеру, диагноз), даёт отличные метрики, но полностью уничтожает модель, она становится бесполезна.

🔬 Метрики vs. реальная ценность Accuracy 95% звучит здорово, но при несбалансированных классах это почти ничего не значит. Я теперь смотрю на recall, precision и ROC-AUC в зависимости от задачи.

🪬Этика и приватность Медицинские данные требуют уважения: анонимность и безопасность.