https://github.com/weave-os/router Легковесный прокси-сервер (умный шлюз) с открытым исходным кодом, созданный для оптимизации расходов на LLM в агентных системах.
Он перехватывает запросы к нейросетям и менее чем за 50 миллисекунд автоматически решает, какую модель (например, дорогую GPT-4o или дешевую Claude Haiku / GPT-4o-mini) лучше всего отправить для выполнения конкретного шага. По заявлениям разработчиков, это позволяет снизить затраты на API на 40–70% без потери качества работы агента.
- Универсальный API: Поддерживает форматы запросов Anthropic Messages, OpenAI Chat Completions и Gemini. Работает со стримингом, вызовами инструментов (tools) и зрением (vision).
- Поддержка любых моделей: Работает с провайдерами напрямую или через OpenRouter (DeepSeek, Llama, Qwen, Mistral и др.).
- Безопасность (BYOK): Все ключи от API-провайдеров хранятся на вашем сервере в зашифрованном виде, а промты отправляются напрямую к ИИ, минуя сервера Weave.
- Аналитика: Из коробки выдает OTLP-логи, которые можно смотреть в родном веб-интерфейсе или отправлять в Datadog / Grafana.
Я ранее уже писал о подобном инструменте. Но omniroute - это огромный комбайн по роутингу. А weave предоставляет чистый минимум. Сам же я программирую только дипсиком. Соотношение цена за токен / качество у него достойное.
В этом посте были ссылки, но мы их удалили по правилам Сетки