В Гарварде проверили ИИ не на задачках, а на реальных пациентах.
В Science вышло исследование Harvard Medical School и Beth Israel Deaconess Medical Center. Исследователи взяли 76 пациентов из приёмного отделения Beth Israel и сравнили диагнозы двух врачей с ответами моделей OpenAI o1 и 4o.
Оценка была вслепую: другие врачи проверяли диагнозы и не знали, где ответ человека, а где ИИ.
На первичной сортировке o1 дала точный или очень близкий диагноз в 67% случаев.
У двух врачей было 55% и 50%. То есть ИИ сравнивали не с учебным тестом, а с врачами на реальных случаях из приёмного отделения.
Пруф: исследование в Science, статья TechCrunch. https://techcrunch.com/2026/05/03/in-harvard-study-ai-offered-more-accurate-diagnoses-than-emergency-room-doctors/