Новости за последний час
Anthropic выкатили Claude Sonnet 5 — агентную модель, которая уже не просто отвечает, а тянет длинные многошаговые задачи. По бенчмаркам она почти догнала Opus 4.8, при этом стоит заметно дешевле. Для кода прирост особенно заметный: в тестах модель уверенно обходит Sonnet 4.6.
Но самое интересное — не цифры в таблицах, а поведение в реальной отладке: тестер описал случай, где модель сама написала воспроизводящий тест, внесла фикс и потом откатила его, чтобы проверить баг ещё раз. Это уже похоже на инструмент, который может реально разгрузить инженеров, а не просто красиво звучать в анонсе.
IBM Research тоже подкинула полезную вещь для индустрии: ScarfBench — бенчмарк для оценки ИИ-агентов, которые мигрируют корпоративные Java-фреймворки. Задача скучная, дорогая и очень жизненная, так что нормальный тест для таких агентов нужен давно.
И на фоне этого стартап Etched, который делает чипы для ИИ и конкурирует с Nvidia, дошёл до оценки в $5 млрд и $1 млрд продаж. Рынок железа для ИИ по-прежнему любит тех, кто обещает ускорение не на слайдах, а в реальных нагрузках.
Источники: Hugging Face Blog, Neurogen, TechCrunch
Все новости: ai.popovs.tech