Anthropic выпустила Opus 4.8

Сегодня вышел Claude Opus 4.8 — всего через 41 день после прошлой модели. Для Anthropic, которая обычно тянет паузы по 3–7 месяцев, это почти спринт. Сигнал понятный: в гонке стало тесно.

По бенчмаркам апдейт скромный — цифры подросли где на процент, где на девять. Agentic coding на SWE-Bench Pro: с 64,3% до 69,2%. Цена осталась прежней. Если смотреть только в таблицу, легко зевнуть. Но самое интересное — не в таблице.

Ставка на честность

Главное, чем Anthropic выделяет 4.8 — не ум, а "честность".

По словам Anthropic модель стала охотнее сообщать о собственных сомнениях и заметно реже выдаёт ничем не подкреплённые утверждения. По внутренним оценкам компании, Opus 4.8 примерно вчетверо реже предшественника пропускает без комментария ошибки в коде, который сам же и написал.

Для всех, кто ловил ассистента на уверенно сочинённой ерунде, это важнее лишних процентов на тесте. Уверенная галлюцинация обходится дороже.

Что ещё нового

Быстрый режим работает примерно в 2,5 раза шустрее и втрое дешевле, чем раньше.

На claude.ai появился контроль усилий — сам решаешь, сколько модели «думать» над ответом. Для сложных задач есть режимы «extra» и «max».

Dynamic Workflows (research preview): Claude Code умеет планировать работу и запускать сотни параллельных субагентов в одной сессии. На практике — миграции масштаба всей кодовой базы, сотни тысяч строк от старта до мёрджа.

Что за кадром

По терминальному кодингу вперёд по-прежнему вырывается GPT-5.5. И есть слон в комнате — Mythos, самая мощная модель Anthropic, которую держат взаперти после осторожного превью с вопросами по кибербезопасности. Обещают открыть «в ближайшие недели».

Anthropic выпустила Opus 4.8 | Сетка — социальная сеть от hh.ru