Как сократить расходы на агентов в 5 раз⚡
На Reddit человек описал как построил гибридного агента на своём железе: топовая модель вроде Claude или GPT только планирует(это около 5% токенов), в это время локальная модель, установленная на сервере и не требующая платных API, делает остальные 95% работы.
Результат: качество топовой модели при стоимости локальной. Иметь своё железо для этого не обязательно. Это архитектурный принцип, который работает даже на облачных моделях, если правильно разделить задачи.
Мы уже делаем это в Контент-заводе👇🏻
Когда парсим большой объём материалов и нужно определить рубрику и целевую аудиторию:
1. Ставим дешёвую модель, ту же Kimi, она справляется с классификацией и раскладкой по категориям без дорогих токенов. 2. Whisper на сервере закрывает транскрибацию вообще без обращений к API. 3. Первый черновик поста делает ChatGPT, и только когда пост одобрен и идёт в финальную версию 4. Подключается Claude Opus по API, чтобы переписать под чеклист качества и голос Три уровня модели под три типа задачи, каждая делает то, для чего она нужна.
👉🏻 Ещё один рабочий шаблон — оркестрация через Hermes: Claude пишет план, DeepSeek или Kimi выполняют задачи, GPT-5.5 проверяет, сверяется с планом и дорабатывает результат.
Там, где большой контекст и нет нужды в глубокой аналитике, используются дешёвые модели. Там, где нужно думать и принимать решения, соответственно, дорогие.
Но важное уточнение: не стоит сразу проектировать трёхуровневую оркестрацию. Правильный порядок: сначала собрать на одной хорошей модели, потом посмотреть где уходит больше всего токенов, и уже тогда разделять.
📌На каком этапе не стоит экономить: на генерации финального результата, который идёт к клиенту или в публикацию, именно там разница в качестве между дешёвой и дорогой моделью ощущается сильнее всего.
24 июня в 12:00 мск в прямом эфире покажу как работают агенты в нашей команде, разберем архитектуру и задачи, которые можно делегировать уже сейчас