Твой — рабочий инструмент

Неделя прошла в спорах «GPT 5.6 или Claude Fable 5». Я не спорю — я считаю.

Питер Янг протестировал обе на шести задачах — уже на первой «ничья». Бенчмарк агентных задач: 88,8% против 84,3% в пользу GPT. Цена по API — у GPT вдвое ниже. Переезжаем? Нет. Чужой тест отвечает на чужой вопрос.

Мой способ на один вечер: пять своих типовых задач → одинаковый промпт в обе модели → одно число в таблицу: минуты доводки до «можно отдавать». Побеждает не «умнее», а «дешевле доводить».

Из подводного: конфиденциальное в облачные модели не заливаем; у GPT 5.6 три версии (Sol/Terra/Luna) — сравнивай сопоставимую; повторяй тест раз в квартал.

Чужой бенчмарк выбирает чемпиона. Твой — рабочий инструмент.

Твой — рабочий инструмент | Сетка — социальная сеть от hh.ru