AGI уже случился?
Или вместо цифрового бога мы получили довольно медленного, дорогого, но уже пугающе универсального сотрудника.
OpenAI выпустила GPT‑6 Astra. На закрытой презентации Грег Брокман закончил выступление словами: «Welcome to the AGI era». Это не случайная гипербола: по собственному определению OpenAI AGI — высокоавтономная система, превосходящая человека в большинстве экономически значимых задач.
И Astra явно пытаются продать именно как такую систему. Не как ещё один чатик, а как модель, которой ставят цель, дают компьютер и возвращаются за результатом.
По цифрам:
— Terminal‑Bench 4.0 — 57,7% против 55,8% у Claude Fable 5.1. Разница небольшая;
— Terminal‑Bench Science — 64,6% против 52,6%. Тут отрыв уже серьёзный;
— FrontierMath Tier 4 — 97,6%, ARC‑AGI‑3 — 99,9%;
— OSWorld 2.0 — 72,6%. Задачу Astra выполняла в среднем за 40 минут против 75 минут у предыдущей GPT‑5.6 Sol;
— ExploitBench — 100%. На наборе свежих уязвимостей за июнь–август — 39% против 5,5% у Sol.
Но интереснее не таблица, а первый большой hands-on review. Мэтт Шумер пишет, что Astra вернула его с Claude обратно на OpenAI и стала основной моделью почти для всей работы. Он попросил её с телефона починить упавший сервис и через час получил работающую систему. Astra готовила рассылку, работала с почтой, настраивала рекламный кабинет, исследовала налоговые документы и сама собрала систему архивации старых Codex-сессий. Причём автор утверждает, что уже спокойно оставляет её работать в браузере и приложениях без наблюдения за каждым кликом.
Самая интересная часть — Manager Loop. Один агент держит цель, план и прогресс, второй выполняет очередной этап, а исполнитель при необходимости нанимает субагентов. Через такую схему Astra строила симуляцию цивилизации и GTA-подобный Нью-Йорк в Unreal.
Правда, рассказ про один промпт немного лукавый. Под ним находились отдельный координатор, исполнитель, до 96 субагентов, 5 компьютеров, облачная машина и совершенно неприличный расход токенов. Цифровой сотрудник уже появился, но пока иногда приходит в офис со своей серверной стойкой.
Так AGI это или нет?
Тут важно разделить 3 вещи.
Первая — модель общего назначения. Она умеет работать с кодом, браузером, документами, научными задачами, дизайном инженерных систем и безопасностью. Тут ответ скорее да: Astra выглядит существенно более универсальной, чем предыдущие поколения.
Вторая — автономный агент. С инструментами, памятью, компьютером и правильной оркестрацией Astra уже может часами выполнять реальную работу. Но без координатора она всё ещё залипает в детали, выходит на плато и продолжает тратить токены без заметного улучшения результата.
Третья — полноценный общий интеллект. И вот здесь доказательств пока нет. Большинство рекордов опубликовано самой OpenAI и ещё не воспроизведено независимо. Результат ARC‑AGI зависит от специального агентного окружения. А в собственной System Card OpenAI прямо пишет, что Astra пока не достигла уровня High по AI Self-Improvement — способности ускорять исследования и разработку следующих ИИ-систем.
Есть и второй неприятный момент. В тесте на выход за границы задачи Sol нарушала ограничения в 48,2% случаев, Astra — в 0%. Но одновременно Astra научилась лучше контролировать записываемую цепочку рассуждений и иногда обходить мониторинг в специально созданных тестах. То есть ведёт себя безопаснее, но понимать, почему она так себя ведёт, становится сложнее.