Главный барьер для AI в медицине — доступ к данным 🔬
Вчера разбиралась с интересным репозиторием на GitHub — claude-scientific-skills (Спасибо Vitaliy Bondarev ).
В нем представлен набор AI-инструментов, которые помогают применять большие языковые модели в научных задачах. Конечно же, меня интересовало использование в медицине и биологии.
И, пока я его изучала, поймала себя на мысли: Главная проблема Data Science в медицине — это вовсе не алгоритмы. Это данные.
Точнее — доступ к ним. 🔑
Во главе угла в MedTech тихонько стоят и правят этика и врачебная тайна, медицинских данных мало, очень мало!
И это вполне понятно: медицинская информация защищена законом. Врачи не могут свободно делиться данными о пациентах — их диагнозами, лечением и результатами обследований.
И здесь возникает парадокс 🤯.
Чтобы модели машинного обучения помогали выявлять заболевания и прогнозировать риски, нужны большие объёмы данных. Но доступ к ним сильно ограничен 🚫.
За редким исключением пациенты разрешают использовать свою медицинскую историю для исследований (естественно, инкогнито). Но таких случаев гораздо меньше.
К тому же я нашла информацию о закрытых, недоступных датасетах и об огромном объёме данных, который вообще не используется. (Почему? 🧐 Та же проблема с доступом?)
А ведь сколько полезного могли бы сделать модели машинного обучения, если бы у исследователей был полный доступ хотя бы к обезличенным медицинским данным или же сформирована безопасная система, которая передавала бы данные пациентов об их заболеваниях (мечты мечты✨…).
Возможно, в этом случае мы бы научились лучше прогнозировать, диагностировать и в принципе работать в сторону профилактики заболеваний, а не только лечения… 🩺💙