Твой — рабочий инструмент
Неделя прошла в спорах «GPT 5.6 или Claude Fable 5». Я не спорю — я считаю.
Питер Янг протестировал обе на шести задачах — уже на первой «ничья». Бенчмарк агентных задач: 88,8% против 84,3% в пользу GPT. Цена по API — у GPT вдвое ниже. Переезжаем? Нет. Чужой тест отвечает на чужой вопрос.
Мой способ на один вечер: пять своих типовых задач → одинаковый промпт в обе модели → одно число в таблицу: минуты доводки до «можно отдавать». Побеждает не «умнее», а «дешевле доводить».
Из подводного: конфиденциальное в облачные модели не заливаем; у GPT 5.6 три версии (Sol/Terra/Luna) — сравнивай сопоставимую; повторяй тест раз в квартал.
Чужой бенчмарк выбирает чемпиона. Твой — рабочий инструмент.