При чем тут логистика
Сегодня вспоминал логистическую регрессию. Как я говорил у меня уже был пет-проект по медицине. Это популярный датасет взятый с Keggle (Breast Cancer Wisconsin (Diagnostic) Dataset) , задача - предсказание типа опухоли (злокачественная\доброкачественная) по результатам биопсии тонкой иглы. На проект было затрачено около 10 часов, за это время я провёл анализ датасета, заполнил пропуски и провёл ещё много разных действий по предобработке данных, но так и не пришёл к написанию прогнозного кода. Сегодня я занялся именно этим. Хватило примерно часа чтобы приготовить прогноз и можно сказать что я достиг некоторого успеха. Тестовая часть выборки составила 175 случаев из них вышло 4 ложно-положительных и 4 ложно-отрицательных Точность прогноза - 95%. Нужно подчеркнуть что это очень хороший и популярный датасет в котором сложно получить плохие результаты. Но 95% для простенькой модели логисчитеской регресии довольно хороший результат.
Вообще всё это довольно интересно. Смотрите как выглядят признаки в разрезе этого датасета: ['Густота скопления', 'Однородность размера ячейки', 'Однородность формы ячейки', 'Маргинальная адгезия', 'Размер одиночной_эпителиальной ячейки', 'Голые ядра', 'Бледный_хроматин', 'Нормальные ядра', 'Митозы'] целевая переменная - True или False для типа рака. Вообще не понимая, что такое например 'Маргинальная адгезия', можно делать достаточно точный прогноз. Выглядит как магия.