Продолжаем экономить токены при использовании ИИ агентов

В прошлом посте было упоминание о деградации контекста. Хочу остановиться на этом подробнее, ведь именно это зачастую приводит не только к “тупости” модели/агента, но и к сумашедшим тратам токенов даже на старших версиях подписки.

Что к этому приводит? Представьте, вы задаете агенту вопрос - получаете ответ. Потом еще вопрос, и еще вопрос.

И вот в чате уже 50, 60 … 100 сообщений.

Что делает агент чтобы ответить на 101е сообщение? Да, он читает и анализирует предыдущие 100 сообщений и ответов на них. Мы этого не видим, это происходит “в голове” у ИИ. Как и у нас, когда с нами ведут беседу, мы отвечаем исходя из контекста, а не исходя из последнего вопроса.

Как избежать? Да просто. Используйте новые чаты для новых тем. Используйте отдельные проекты. Чистите историю, проверяйте что о вас запомнил ваш ИИ. Удалите мусор из библиотек.

Сделайте персональную настойку модели, задайте правила, чтобы агент отвечал коротко и по делу “без воды”.

Эти простые действия позволят экономить токены, и не превратят вашего помощника из Джарвиса в Железного дровосека.