Новости к 08:00

✦ Ну наконец-то. OpenAI вытащила Astra, и тут мне нравится ровно одна вещь: если модель реально тащит ваш сценарий, квоту можно не размазывать по 5 штукам, а залить в одну. Это просто меньше боли.

Для меня тут вообще не про название. Как только модель становится достаточно универсальной, дробить лимит между несколькими вариантами — тупо бессмысленно. Если Astra правда сильнее именно в ваших задачах, кормить её целиком — нормальная логика. Без игры в «а вдруг другая версия лучше».

✦ Берни Сандерс и Грег Касар внесли законопроект Ban Artificial Superintelligence Act. Он предлагает заморозить все разработки ИИ в США и запретить системы, которые сравнялись с человеком или обогнали его по когнитивным способностям. За нарушение — уголовка, до 20 лет.

✦ OpenAI представила GPT-6 Astra на сайте компании. Пока без деталей. Посмотрим, что там реально внутри, а не на красивом анонсе.

✦ Грег Брокман говорит, что рубеж AGI, по его личной оценке, уже пройден. И по тому, что показали, модель правда не только советует, но и лезет прямо внутрь программ: форматирует договоры, собирает 3D-игры в Unity, проектирует платы в KiCad, делает анимации в Blender и заполняет черновик налоговой декларации. Astra обещают отдать пользователям Plus, Pro, Business и Enterprise, плюс в API — уже в ближайшие дни. Отдельная история — кибербезопасность: это первая модель OpenAI с критическим уровнем кибервозможностей. Она находила неизвестные уязвимости и собирала рабочие цепочки эксплойтов.

✦ OpenAI выкатили GPT-6 Astra и сразу показали цифры. На заявленных бенчмарках у модели 97,6% на FrontierMath Tier 4 v2, 74,1% на DeepSWE v1.1, 95,9% на BenchCAD, 96% на GPQA Diamond, 100% на ExploitBench и 98,6% на ARC-AGI-3.

Особенно жирно выглядят математика, программирование и кибербезопасность. Доступ для платных подписчиков ChatGPT и через API обещают открыть в ближайшие дни. Грег Брокман назвал это большим технологическим достижением и сказал, что это поколенческий скачок в возможностях ИИ.

✦ OpenAI опубликовала бенчмарки GPT-6 Astra, и модель действительно хорошо смотрится в ряде тестов.

Заявленные показатели: — FrontierMath Tier 4 v2 — 97,6% — DeepSWE v1.1 — 74,1% — BenchCAD — 95,9% — GPQA Diamond — 96% — ExploitBench — 100% — ARC-AGI-3 — 98,6% по заявленным данным

Сильнее всего торчат математика, программирование и кибербезопасность. Платным пользователям ChatGPT и через API доступ собираются открыть в ближайшие дни.

Источники: AI Copilot Channel, AI Post, AI & Deep Learning, Нейродвиж, AI Post, Machinelearning

Все новости: ai.popovs.tech

#Anthropic #OpenAI #Claude


В этом посте были ссылки, но мы их удалили по правилам Сетки