GPT-5 и шаг к искусственному рассуждению

Недавно Джереми Берман представил экспериментальную версию многомодельной системы на базе GPT-5 Pro, которая показала впечатляющий результат – 88 из 100 баллов в тесте ARC-AGI-1. Для понимания масштаба: обычный GPT-5 Pro набирает около 70 %.

ARC-AGI-1 — это один из самых сложных тестов для проверки «понимания» ИИ. Он оценивает не способность модели вспоминать шаблоны, а её умение обобщать – находить скрытые закономерности и применять их к новым задачам. Это тест не на память, а на рассуждение. Главная идея эксперимента Бермана – мультиагентный, или эволюционный подход. Вместо одной модели работает целая группа её копий. Каждая предлагает своё решение, затем лучшие варианты «выживают», комбинируются и проходят следующий цикл. Так система постепенно «учится думать», улучшая собственные гипотезы.

Если эти результаты подтвердятся на закрытых наборах задач (где ответы заранее неизвестны), это может стать серьёзным шагом к системам, которые рассуждают более по-человечески, а не просто повторяют заученные шаблоны. Тем не менее, остаются вопросы. Эксперимент проводился на случайной выборке, а не на полном скрытом тесте. Обычно после официальной проверки показатели снижаются.

Кроме того, процесс весьма дорогой — около 27 долларов за задачу и почти 12 часов вычислений. Пока что это исследование скорее демонстрирует потенциал направления, чем готовое решение. Но тенденция очевидна: будущее ИИ всё больше движется в сторону не одной универсальной модели, а множества взаимодействующих агентов, которые совместно ищут лучшие ответы. И, возможно, именно в этом подходе – ключ к «мышлению» машин.

GPT-5 и шаг к искусственному рассуждению | Сетка — социальная сеть от hh.ru