Самые ТОПовые ИИ-модели не прошли «Последний экзамен человечества»
Более 1000 экспертов из 500 научных учреждений в 50 странах создали бенчмарк «Humanity's Last Exam» (HLE). В нем 3000 вопросов, 42% из которых по математике.
Результат удручающий: самые продвинутые модели справились лишь с 10% задач (лучше всех себя показал DeepSeek R1). При этом в 80% случаев ИИ был твердо уверен в своей правоте.
До замены человека еще далековато…или…
ТГ канал - https://t.me/qatsp #тестирование #тестируй #душни #наслаждайся