Моделька за моделькой 🐇
Да уж, месяц такой насыщенный, что лидеры на бенчмарках не держаться и недели на первом месте.
Claude Opus 4.5 от Anthropic ворвалась в топ, в т.ч. по программированию.
🤓 Интересно, что они прогнали модель через реальное тестовое задание для кандидатов на позицию performance engineer. Жесткое, на 2 часа, под давлением. Не LeetCode-дрочильня, а задача на архитектурное мышление и judgment в условиях дефицита времени. Результат? Opus 4.5 набрал баллов больше, чем любой живой кандидат за всю историю найма в компанию. Не "лучше среднего", а лучше всех.
Для разработчиков в API завезли параметр effort. Теперь мы можем программно регулировать: нам нужно "быстро и дешево" или "подумай, потрать токены, но реши проблему". На максималках Opus 4.5 уделывает Sonnet 4.5 (который и так был топом) на 4.3%, потребляя при этом на 48% меньше токенов.
💳 Прайс — $5 вход / $25 выход за 1 млн токенов.