Claude Fable 5.1. Гонка теперь не за «самую умную модель», а за самого автономного агента

Anthropic показали Fable 5.1. По их собственным тестам апдейт получился довольно жирным.

Самое интересное: — научные агентные задачи: 24,7% → 52,6% — Terminal-Bench: 42% → 55,8% — бизнес-процессы: 17,1% → 31,4% — работа с компьютером: 72,9% → 77,9% — CursorBench: 70,5% → 73,4%

При этом другие метрики почти не изменились. И вот это, кажется, главное. Модели уже достаточно хорошо отвечают на вопросы, теперь вот осталось научить их долго работать без человека: лазить по репозиторию, пользоваться терминалом и инструментами, искать информацию, выполнять цепочку действий и проверять собственный результат.

Думаю качественный скачок больше не в том, что «Модель стала отвечать на 10% умнее», а как «я дал задачу и через три часа получил готовый результат». И это кажется правильным. Потому что порой просто смешно наблюдать за тем, как модель, которая "умнее phd во многих сферах" с четвёртого раза не может запустить команду в PowerShell. А такие мелочи оочень сильно влияют и на скорость, и на общее ощущение от работы.

В таблице Anthropic Fable 5.1 обходит и Opus 5, и GPT-5.6 Sol почти во всех агентных тестах. Но тут, конечно, ждём независимых проверок - сейчас у всех бенчмарки ради бенчмарков с цифрами, которые ничего не гарантируют.

По цене всё так же дорого. И лимиты выжирает просто в раз. Но зато чтение из кэша подешевело, так что станет чуть лучше.

Но направление в любом случае самое интересное. Теперь будет гонка за агентность. И это явно гораздо интереснее +3% в очередном тесте на знания мира.

Теперь ждём в ближайшее время ответ от OpenAI ⚡️

Claude Fable 5.1. Гонка теперь не за «самую умную модель», а за самого автономного агента
Anthropic показали Fable 5.1. По их собственным тестам апдейт получился довольно жирным | Сетка — социальная сеть от hh.ru