Anthropic выпустила Opus 4.8
Сегодня вышел Claude Opus 4.8 — всего через 41 день после прошлой модели. Для Anthropic, которая обычно тянет паузы по 3–7 месяцев, это почти спринт. Сигнал понятный: в гонке стало тесно.
По бенчмаркам апдейт скромный — цифры подросли где на процент, где на девять. Agentic coding на SWE-Bench Pro: с 64,3% до 69,2%. Цена осталась прежней. Если смотреть только в таблицу, легко зевнуть. Но самое интересное — не в таблице.
Ставка на честность
Главное, чем Anthropic выделяет 4.8 — не ум, а "честность".
По словам Anthropic модель стала охотнее сообщать о собственных сомнениях и заметно реже выдаёт ничем не подкреплённые утверждения. По внутренним оценкам компании, Opus 4.8 примерно вчетверо реже предшественника пропускает без комментария ошибки в коде, который сам же и написал.
Для всех, кто ловил ассистента на уверенно сочинённой ерунде, это важнее лишних процентов на тесте. Уверенная галлюцинация обходится дороже.
Что ещё нового
Быстрый режим работает примерно в 2,5 раза шустрее и втрое дешевле, чем раньше.
На claude.ai появился контроль усилий — сам решаешь, сколько модели «думать» над ответом. Для сложных задач есть режимы «extra» и «max».
Dynamic Workflows (research preview): Claude Code умеет планировать работу и запускать сотни параллельных субагентов в одной сессии. На практике — миграции масштаба всей кодовой базы, сотни тысяч строк от старта до мёрджа.
Что за кадром
По терминальному кодингу вперёд по-прежнему вырывается GPT-5.5. И есть слон в комнате — Mythos, самая мощная модель Anthropic, которую держат взаперти после осторожного превью с вопросами по кибербезопасности. Обещают открыть «в ближайшие недели».