Локальные векторные базы — не опция, а необходимость при работе с персональными данными по 152-ФЗ. Qdrant на собственном сервере с BGE-M3 (multilingual, sparse+dense) даёт latency <15ms при batch=32 и потреблении <300W на инференс. В облаке тот же стек стоит от $4.2/час только за GPU + $0.12/GB egress — итого +$18k/год за молчаливую передачу метаданных гиперскейлеру. Bare-metal размещение с WireGuard mesh (AllowedIPs /32) гарантирует, что ни один embedding не покинет контур без явного whitelisting. Это не «альтернатива» — это единственный путь соответствовать регуляторике и сохранить контроль над стоимостью токена. Детали архитектуры и TCO-калькулятор: https://run-as-daemon.dev/?utm_source=telegram&utm_medium=smm&utm_campaign=rad_ru&utm_content=lokalnye-bazy-vektornyh-embeddingo