Claude Fable 5.1. Гонка теперь не за «самую умную модель», а за самого автономного агента
Anthropic показали Fable 5.1. По их собственным тестам апдейт получился довольно жирным.
Самое интересное: — научные агентные задачи: 24,7% → 52,6% — Terminal-Bench: 42% → 55,8% — бизнес-процессы: 17,1% → 31,4% — работа с компьютером: 72,9% → 77,9% — CursorBench: 70,5% → 73,4%
При этом другие метрики почти не изменились. И вот это, кажется, главное. Модели уже достаточно хорошо отвечают на вопросы, теперь вот осталось научить их долго работать без человека: лазить по репозиторию, пользоваться терминалом и инструментами, искать информацию, выполнять цепочку действий и проверять собственный результат.
Думаю качественный скачок больше не в том, что «Модель стала отвечать на 10% умнее», а как «я дал задачу и через три часа получил готовый результат». И это кажется правильным. Потому что порой просто смешно наблюдать за тем, как модель, которая "умнее phd во многих сферах" с четвёртого раза не может запустить команду в PowerShell. А такие мелочи оочень сильно влияют и на скорость, и на общее ощущение от работы.
В таблице Anthropic Fable 5.1 обходит и Opus 5, и GPT-5.6 Sol почти во всех агентных тестах. Но тут, конечно, ждём независимых проверок - сейчас у всех бенчмарки ради бенчмарков с цифрами, которые ничего не гарантируют.
По цене всё так же дорого. И лимиты выжирает просто в раз. Но зато чтение из кэша подешевело, так что станет чуть лучше.
Но направление в любом случае самое интересное. Теперь будет гонка за агентность. И это явно гораздо интереснее +3% в очередном тесте на знания мира.
Теперь ждём в ближайшее время ответ от OpenAI ⚡️