Что писали о Claude Haiku 5.5

Дешевле, быстрее и с регулятором усилий

По словам Anthropic, Claude Haiku 5.5 — самая дешёвая и быстрая из их небольших моделей. В среднем она стоит примерно на 75% меньше, чем Haiku 4.5. Для запросов до 100 000 токенов цена ниже на 90%, для запросов больше 100 000 — на 50%. Модель доступна в AWS, Google Cloud и Microsoft Azure.

Новое — первый в линейке Haiku регулятор усилий (effort): для каждой задачи можно выбрать, что важнее, стоимость или качество.

По заявлению компании, Haiku 5.5 создан для массовых и дешёвых задач: саммари, классификация, рутинная работа. Её также рекомендуют как субагента рядом с Opus 5.5 и Sonnet 5.5 в задачах программирования. Одновременно Anthropic вдвое снизил цену чтения из кэша для Sonnet 5.5; по оценке компании, это примерно на 20% дешевле в длинных задачах. Ещё на странице сказано, что у модели обновлённый токенизатор и она тратит чуть больше токенов на задачу; конкретного процента нет.

Что писали под постом

Чаще всего повторяется мысль, что выигрыш в том, что маленькая модель берёт на себя большую часть шагов агента. Один из комментаторов пишет, что в агентных схемах основная масса шагов — классификация и короткие саммари, поэтому перенос их на Haiku, по его словам, экономит больше, чем снижение цены флагмана. Другой комментатор говорит, что большинство шагов в цепочке агента — маршрутизация и извлечение данных, и там реальная экономия.

Также по тарифам со страницы Anthropic подсчитали: запрос на 99 000 токенов стоит 10% от прежней цены, а на 101 000 — 50%, то есть цена за токен скачет примерно в пять раз. Страница не уточняет, это жёсткий порог или ступени. Агентные циклы, которые копят историю, могут перескочить порог незаметно. Добавляют: более высокий effort тянет больше выходных токенов, а они самые дорогие, поэтому 75% из заголовка на практике, могут не получиться.

Один из комментаторов приводит результаты OSWorld 2.1 (offline subset): Haiku 4.5 — 15,7%, Haiku 5.5 — 72,4%. Эти же цифры есть на странице анонса Anthropic.

Скепсис

Инженер пишет, что посты с бенчмарками — плохой способ объяснить возможности модели, и собирается проверить её сам. Один пользователь тестировал модель и остался недоволен. Другой ждёт, когда у моделей Claude появится вывод картинок.

Один комментатор тестирует модель на CRM-данных, другой — на браузерных агентах. Третий спрашивает, как другие измеряют компромисс качества и скорости в поддержке и классификации.


Ряд комментариев сходятся на одной мысли: важна не цена токена, а цена законченного результата с учётом повторов и ручной проверки.