Не всё потеряно для людей.

Есть исследование Agents’ Last Exam — и там хороший холодный душ для всех разговоров про «ИИ сейчас заменит экономику, людей, жену».

Это новый бенч от UC Berkeley RDI и RDI Foundation: 300+ экспертов, 100+ организаций, 55 подотраслей, 13 направлений, 1 500+ задач в пуле. В первой публичной выдаче — 152 задачи.

Что под капотом?

Агенту дают среду, терминал, интерфейс, файлы и задачу. Например: подготовить медицинское описание по снимку, собрать сцену в Unreal Engine, разнести партитуру по партиям оркестра, настроить производственный софт, сделать 3D-анимацию, посчитать результат спортивного выступления.

Потом скрытая проверка смотрит: нужный файл есть? формат правильный? ограничения соблюдены? результат совпал с эталоном?

На самом тяжёлом уровне в статье средний полный проход — ниже 1%. В блоге Berkeley для протестированных передовых агентов на этом уровне вообще указан 0% успеха.

Свежая таблица результатов уже двигается, но не так весело, как хочется.

GPT-5.5 без усиленного режима на самых тяжёлых задачах — 0% полного прохода. GPT-5.5 с усиленным режимом — около 1,3%. Opus 4.7 в нескольких связках — тоже 0%, кроме связки с Cursor и высоким режимом, где около 2,6%.

На всём наборе лучшие строки уже выше: примерно 25–31% полного прохода. Но это не «замена людей». Это всё ещё агент, который часто не доносит работу до конца.

Самый частый провал: агент уверенно говорит, что всё сделал, а потом выясняется — нет файла, не тот формат, пропущено поле, сломано ограничение.

Источник: Agents’ Last Exam — https://agents-last-exam.org/