Когда веса модели лежат в облаке — даже в EBS или S3 — вы платите не только за хранение, но за фундаментальную задержку. Локальный NVMe-массив (например, RAID0 из Samsung PM1743) обеспечивает latency ~7 мкс и пропускную способность >14 ГБ/с. В сравнении: AWS S3 — 120+ мс на cold fetch, EBS gp3 — 1–2 мс при идеальных условиях, но с unpredictable tail latency под нагрузкой. Для vLLM или TGI это критично: prefetch весов должен быть быстрее, чем декодинг токена. Иначе GPU простаивает, token/s падает, а стоимость токена взлетает. На RTX 4090 с AWQ 4-bit и локальными весами — 38 токенов/сек при 112 Вт. В облаке — даже на p4d.24xlarge — вы получите <15 токенов/сек из-за I/O bottleneck и FP8 overhead. Суверенная инфраструктура не терпит компромиссов на уровне storage tier. Подробнее — https://run-as-daemon.dev/?utm_source=telegram&utm_medium=smm&utm_campaign=rad_ru&utm_content=hranenie-vesov-modeley-na-vysokosko

Когда веса модели лежат в облаке — даже в EBS или S3 — вы платите не только за хранение, но за фундаментальную задержку | Сетка — социальная сеть от hh.ru