Архитектура AI-сервисов: монолит убивает latency и GPU

Всем привет 👋 😊

Вы когда-нибудь попадали в ситуацию, когда AI-модель на нагрузке начинает тормозить, а GPU греется как утюг? 🥵

Мы с командой разобрали реальную боевую архитектуру low‑latency инференса на #HighLoad

В статье – почему монолит убивает задержки, как выбрать между vLLM и SGLang, зачем нужны continuous batching и admission control.

Схемы, примеры из продакшена и честные ограничения.

Ссылка на статью: https://habr.com/ru/companies/otus/articles/1031286/

Буду рад обсудить в комментариях 🤝

#LLM #AIArchitecture #Inference