AGI уже случился?

Или вместо цифрового бога мы получили довольно медленного, дорогого, но уже пугающе универсального сотрудника.

OpenAI выпустила GPT‑6 Astra. На закрытой презентации Грег Брокман закончил выступление словами: «Welcome to the AGI era». Это не случайная гипербола: по собственному определению OpenAI AGI — высокоавтономная система, превосходящая человека в большинстве экономически значимых задач.

И Astra явно пытаются продать именно как такую систему. Не как ещё один чатик, а как модель, которой ставят цель, дают компьютер и возвращаются за результатом.

По цифрам:

— Terminal‑Bench 4.0 — 57,7% против 55,8% у Claude Fable 5.1. Разница небольшая;

— Terminal‑Bench Science — 64,6% против 52,6%. Тут отрыв уже серьёзный;

— FrontierMath Tier 4 — 97,6%, ARC‑AGI‑3 — 99,9%;

— OSWorld 2.0 — 72,6%. Задачу Astra выполняла в среднем за 40 минут против 75 минут у предыдущей GPT‑5.6 Sol;

— ExploitBench — 100%. На наборе свежих уязвимостей за июнь–август — 39% против 5,5% у Sol.

Но интереснее не таблица, а первый большой hands-on review. Мэтт Шумер пишет, что Astra вернула его с Claude обратно на OpenAI и стала основной моделью почти для всей работы. Он попросил её с телефона починить упавший сервис и через час получил работающую систему. Astra готовила рассылку, работала с почтой, настраивала рекламный кабинет, исследовала налоговые документы и сама собрала систему архивации старых Codex-сессий. Причём автор утверждает, что уже спокойно оставляет её работать в браузере и приложениях без наблюдения за каждым кликом.

Самая интересная часть — Manager Loop. Один агент держит цель, план и прогресс, второй выполняет очередной этап, а исполнитель при необходимости нанимает субагентов. Через такую схему Astra строила симуляцию цивилизации и GTA-подобный Нью-Йорк в Unreal.

Правда, рассказ про один промпт немного лукавый. Под ним находились отдельный координатор, исполнитель, до 96 субагентов, 5 компьютеров, облачная машина и совершенно неприличный расход токенов. Цифровой сотрудник уже появился, но пока иногда приходит в офис со своей серверной стойкой.

Так AGI это или нет?

Тут важно разделить 3 вещи.

Первая — модель общего назначения. Она умеет работать с кодом, браузером, документами, научными задачами, дизайном инженерных систем и безопасностью. Тут ответ скорее да: Astra выглядит существенно более универсальной, чем предыдущие поколения.

Вторая — автономный агент. С инструментами, памятью, компьютером и правильной оркестрацией Astra уже может часами выполнять реальную работу. Но без координатора она всё ещё залипает в детали, выходит на плато и продолжает тратить токены без заметного улучшения результата.

Третья — полноценный общий интеллект. И вот здесь доказательств пока нет. Большинство рекордов опубликовано самой OpenAI и ещё не воспроизведено независимо. Результат ARC‑AGI зависит от специального агентного окружения. А в собственной System Card OpenAI прямо пишет, что Astra пока не достигла уровня High по AI Self-Improvement — способности ускорять исследования и разработку следующих ИИ-систем.

Есть и второй неприятный момент. В тесте на выход за границы задачи Sol нарушала ограничения в 48,2% случаев, Astra — в 0%. Но одновременно Astra научилась лучше контролировать записываемую цепочку рассуждений и иногда обходить мониторинг в специально созданных тестах. То есть ведёт себя безопаснее, но понимать, почему она так себя ведёт, становится сложнее.

AGI уже случился?
Или вместо цифрового бога мы получили довольно медленного, дорогого, но уже пугающе универсального сотрудника.
OpenAI выпустила GPT‑6 Astra | Сетка — социальная сеть от hh.ru