Работа с LLM в облаке при наличии российских пользователей — прямой путь к нарушению 152-ФЗ. Даже если данные «не сохраняются», они проходят через юрисдикцию CLOUD Act. Единственное решение — локальный inference-контур: bare-metal сервер с vLLM, RTX 4090/6000 Ada, AWQ 4-bit квантованием и Qdrant для RAG. На таком стеке достигается 38–42 токена/сек при 112 Вт, а PII-очистка (NER + regex + allowlist) выполняется до попадания в модель. Стоимость токена — от ₽0.0008 против ₽0.006+ в Azure OpenAI. Разница — не в цене, а в суверенитете. Детали архитектуры и расчет TCO: https://run-as-daemon.dev/?utm_source=telegram&utm_medium=smm&utm_campaign=rad_ru&utm_content=zaschita-personalnyh-dannyh-152-fz-p