Вы платите за токены — а переплачиваете за архитектуру промпта Databricks опубликовал бенчмарк кодинг-агентов на своей многомиллионной кодовой базе. Вывод: «харнесс, из которого вызывается модель, радикально влияет на стоимость и качество» — стоимость одной и той же задачи на одной и той же модели через разные обвязки отличалась более чем в 2 раза при одинаковом качестве. То есть нам пора переключаться с «Клод лучше!» или «GPT лучше!» на вопрос: какая у вас инфраструктура вокруг агентов.

Модели в целом выровнялись по качеству: на бытовом уровне разница между ними уже не так велика.

То есть пора учиться пользоваться ИИ, строить своё окружение вокруг него на проекте, а не надеяться на вендоров и на то, что они дадут вам лучший “черный ящик”, который будет удачно угадывать, что вам нужно в ваших задачах.