AI Gateway для микросервисов: гайд по интеграции LLM в 2026
Всем привет 👋 😊
Когда микросервисы начинают массово дёргать LLM, счёт за API может вырасти до $50K в месяц. А если одна модель зависнет — падает всё.
В новой статье разбираем, как спроектировать **AI Gateway** — инфраструктурный слой между сервисами и LLM. Без магии, с кодом и реальными практиками.
Обсуждаем: - семантический кеш с TTL и tenant-изоляцией, - контроль токенов и бюджета, - circuit breaker и fallback, - streaming и отмену запросов при disconnect.
Под капотом — Spring Cloud Gateway, Resilience4J и примеры из production.
Ссылка на статью: https://habr.com/ru/companies/otus/articles/1031276/
Буду рад обсудить в комментариях 🤝
· 7 ч
Семантический кеш в шлюзе звучит красиво, но на практике именно он чаще всего ломает tenant-изоляцию. Косинусная близость эмбеддингов не различает "сколько стоит тариф" и "сколько стоит тариф у конкурента", и один клиент получает ответ другого. На проектах с несколькими тенантами кеш по смыслу в итоге прикрывают и оставляют точный матч по нормализованному запросу. Бюджетные лимиты и circuit breaker дают эффект, а вот кеш по смыслу без отдельного слоя проверки прав - это дыра, которую потом дорого закрывать. В гайдах про это обычно ни слова.
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён