Полгода назад ARC-AGI-3 был главным аргументом в спорах.
На днях этот аргумент кончился.
OpenAI выкатили GPT-6 Astra. Прошлое поколение набирало на ARC-AGI-3 семь процентов с копейками, если точнее, 7,8. Astra выбила 98,6.
Если ты за этим тестом не следил, объясню, почему цифра важная. ARC-AGI-3 собирали по обратному принципу к обычным бенчмаркам. Не «дай задачу посложнее», а «дай задачу, которая для человека тривиальна, а для машины невозможна». Модель кидают в мини-игру, которую она никогда не видела. Ни правил, ни цели, ни туториала. Она должна сама потыкаться, понять, как устроен этот мир, что тут считается победой, и дойти до конца. Человек проходит с первого раза. Все среды, 100%, медиана около семи минут. Модели весной набирали от 0,2 до 0,3%. Не двадцать процентов. Ноль целых две десятых.
Именно поэтому тест и был любимым аргументом скептиков. Модель можно натаскать на олимпиадную математику и на код. На незнакомый мир без инструкции натаскать нельзя, там нужно то самое обобщение, которого у моделей не было. Брокман на брифинге закрыл выступление фразой «Welcome to the AGI era» и сказал, что лично он считает, что мы уже там.
Дальше оговорка, без которой цифра врёт. Astra гоняли через свою обвязку от OpenAI, поэтому сравнение с моделями других компаний не совсем равное. Но 7,8 против 98,6 внутри одной компании это всё равно слишком большой скачок, чтобы списать его на настройки. Что из этого следует для практика. Скептический аргумент звучал так: модели не умеют разбираться в незнакомой среде без инструкции. Если это перестало быть правдой, меняется не строчка в таблице, а список задач, которые можно отдать агенту. Не «сделай по подробному ТЗ», а «разберись сам, что тут происходит, и сделай».
При этом 98,6 на игре без правил и 98,6 на твоём легаси это разные цифры. Вторую никто не мерил.
Я не готов называть это AGI. Но аргумент, что до AGI далеко, за сутки заметно подешевел, а нового пока никто не предложил.
А ты куда склоняешься? Это уже AGI, или мы просто научились очень хорошо проходить тесты?