Облачные провайдеры заманивают «эластичным» хранением моделей, но скрывают реальную стоимость: каждый inference требует загрузки весов через медленный объектный storage (обычно S3-совместимый) с latency >50 мс и egress fee от $0.09/ГБ. На bare-metal с RAID0 из четырёх Gen4 NVMe (например, Samsung PM9A1) вы получаете sustained read throughput до 28 ГБ/с и latency <80 мкс — напрямую в память GPU через DMA. Экономика проста: размещение 70B-модели (≈140 ГБ в GGUF Q4_K_M) в AWS обойдётся в $12.6/мес за хранение + $12.6 за один полный inference-прогон (egress). На своём железе — $0 после закупки. Амортизация NVMe за 3 года = $0.11/ГБ/мес против $0.023/ГБ/мес у AWS, но без egress и без зависимости от зоны доступности. Суверенный AI Gateway @run_as_daemon.dev проектируется именно под такой сценарий: vLLM + direct NVMe weights loading + PII-санитизация на границе контура. Подробнее: https://run-as-daemon.dev/?utm_source=telegram&utm_medium=smm&utm_campaign=rad_ru&utm_content=hranenie-vesov-modeley-na-vysokosko