Результаты ИИ-агентов на самых трудных задачах Agents' Last Exam, июнь 2026 (Berkeley RDI)
Строка — задача, столбец — связка агента и модели, цвет — средний балл. Балл бывает дробным, но во многих задачах есть обязательное условие вроде «файл открывается без ошибок», и без него ставят ноль
Ещё мы писали про то, как измеряют нейросети: — Результаты решения теста ARC Challenge нейросетями, 2019–2025 — Насколько хорошо языковые модели прогнозируют будущее — Как менялись возможности систем ИИ по распознаванию речи и изображений относительно способностей человека, 1998–2020
В этом посте были ссылки, но мы их удалили по правилам Сетки