Архитектура AI-сервисов: монолит убивает latency и GPU
Всем привет 👋 😊
Вы когда-нибудь попадали в ситуацию, когда AI-модель на нагрузке начинает тормозить, а GPU греется как утюг? 🥵
Мы с командой разобрали реальную боевую архитектуру low‑latency инференса на #HighLoad
В статье – почему монолит убивает задержки, как выбрать между vLLM и SGLang, зачем нужны continuous batching и admission control.
Схемы, примеры из продакшена и честные ограничения.
Ссылка на статью: https://habr.com/ru/companies/otus/articles/1031286/
Буду рад обсудить в комментариях 🤝