Как я перестал жечь токены…
Часто ли вы задумываетесь о том, насколько уникальны вопросы, которые задают ваши пользователи? Я тут на днях провел небольшой эксперимент и понял очевидную, но почему-то ускользавшую от меня вещь.
Мысль простая: 80% пользователей задают LLM-агенту одни и те же вопросы.
Ну серьезно. Если у вас есть сервис или бот, откройте статистику. Скорее всего, вы увидите там вариации одного и того же: «Как настроить X?», «Почему не работает Y?», «Где мои данные?». Мы привыкли думать, что LLM — это про магию каждый раз нового ответа. Но с точки зрения бизнеса и архитектуры, это просто лишние растраты.
Зачем генерировать ответ дважды?
Представьте: первый пользователь спросил «Как подключить API?». Модель сгенерировала крутой, выверенный ответ. Приходит второй пользователь через час с тем же вопросом. И мы снова платим токены, чтобы модель сделала ту же самую работу.
Это же неэффективно!
Решение, которое лежало на поверхности
Если мы можем собирать статистику частых запросов (а это не сложно, поверьте), мы можем построить кэш.
Как это работает:
Пользователь задает вопрос. Мы проверяем, не отвечали ли мы на такой же недавно.
Если да — отдаем готовый ответ из Redis(или любого другого быстрого хранилища).
Если нет — дергаем LLM, отдаем ответ и сохраняем его для следующих.
Что в итоге?
✅ Качество ответа не падает — пользователь получает ту же информацию.
✅ Скорость иногда даже выше, чем при обращении к модели.
✅ Токены экономятся. А значит, вы экономите бюджет проекта.
Это не rocket science, это просто внимательность к данным. Иногда оптимизация лежит не в коде, а в логике использования.
Мой канал https://t.me/manager_dot_exe