Новости к 08:00
✦ Ну наконец-то. OpenAI вытащила Astra, и тут мне нравится ровно одна вещь: если модель реально тащит ваш сценарий, квоту можно не размазывать по 5 штукам, а залить в одну. Это просто меньше боли.
Для меня тут вообще не про название. Как только модель становится достаточно универсальной, дробить лимит между несколькими вариантами — тупо бессмысленно. Если Astra правда сильнее именно в ваших задачах, кормить её целиком — нормальная логика. Без игры в «а вдруг другая версия лучше».
✦ Берни Сандерс и Грег Касар внесли законопроект Ban Artificial Superintelligence Act. Он предлагает заморозить все разработки ИИ в США и запретить системы, которые сравнялись с человеком или обогнали его по когнитивным способностям. За нарушение — уголовка, до 20 лет.
✦ OpenAI представила GPT-6 Astra на сайте компании. Пока без деталей. Посмотрим, что там реально внутри, а не на красивом анонсе.
✦ Грег Брокман говорит, что рубеж AGI, по его личной оценке, уже пройден. И по тому, что показали, модель правда не только советует, но и лезет прямо внутрь программ: форматирует договоры, собирает 3D-игры в Unity, проектирует платы в KiCad, делает анимации в Blender и заполняет черновик налоговой декларации. Astra обещают отдать пользователям Plus, Pro, Business и Enterprise, плюс в API — уже в ближайшие дни. Отдельная история — кибербезопасность: это первая модель OpenAI с критическим уровнем кибервозможностей. Она находила неизвестные уязвимости и собирала рабочие цепочки эксплойтов.
✦ OpenAI выкатили GPT-6 Astra и сразу показали цифры. На заявленных бенчмарках у модели 97,6% на FrontierMath Tier 4 v2, 74,1% на DeepSWE v1.1, 95,9% на BenchCAD, 96% на GPQA Diamond, 100% на ExploitBench и 98,6% на ARC-AGI-3.
Особенно жирно выглядят математика, программирование и кибербезопасность. Доступ для платных подписчиков ChatGPT и через API обещают открыть в ближайшие дни. Грег Брокман назвал это большим технологическим достижением и сказал, что это поколенческий скачок в возможностях ИИ.
✦ OpenAI опубликовала бенчмарки GPT-6 Astra, и модель действительно хорошо смотрится в ряде тестов.
Заявленные показатели: — FrontierMath Tier 4 v2 — 97,6% — DeepSWE v1.1 — 74,1% — BenchCAD — 95,9% — GPQA Diamond — 96% — ExploitBench — 100% — ARC-AGI-3 — 98,6% по заявленным данным
Сильнее всего торчат математика, программирование и кибербезопасность. Платным пользователям ChatGPT и через API доступ собираются открыть в ближайшие дни.
Источники: AI Copilot Channel, AI Post, AI & Deep Learning, Нейродвиж, AI Post, Machinelearning
Все новости: ai.popovs.tech
В этом посте были ссылки, но мы их удалили по правилам Сетки