Когда веса LLM лежат в облаке, каждый forward pass оплачивает не только compute, но и задержку чтения. AWS EBS io2 — максимум 1.2 ГБ/с при 64K IOPS; локальный NVMe RAID0 из четырёх Samsung 990 Pro — 14+ ГБ/с и 2.5M IOPS. Разница в latency: 80 мкс против 2–4 мс. Это напрямую бьёт по token/s: vLLM на bare-metal с AWQ-весами читает всё из RAM/NVMe за один проход, без ожидания блоков с диска. В облаке — постоянный stall из-за медленного storage и фрагментации snapshot’ов. Стоимость владения: локальный массив на 8 ТБ стоит ~350 тыс. ₽ и служит 5 лет. Облачный аналог — $0.125/ГБ/мес + $0.09/ГБ egress. За год — свыше 2 млн ₽ только за хранение и выгрузку весов. И это без учёта рисков 152-ФЗ. https://run-as-daemon.dev/?utm_source=telegram&utm_medium=smm&utm_campaign=rad_ru&utm_content=hranenie-vesov-modeley-na-vysokosko