Qdrant на собственных серверах с эмбеддингами от BGE-M3 — это не про «он-премис ради он-премис». Это про контроль над полным циклом: от санитизации PII в промпте до хранения векторов без выгрузки за границу. На практике: 4x A10 (24 ГБ VRAM) + NVMe RAID0 дают latency <8 мс при 10K RPS, TCO за 3 года — ~2.1 млн ₽. Pinecone или Weaviate в облаке за тот же период вытянут минимум $180K только за egress и запросы, плюс риски по CLOUD Act. BGE-M3 локально инферится через vLLM с continuous batching — плотность токена 1400 tok/s/Watt. В облаке вы платите за idle GPU и теряете 37% throughput из-за shared PCIe и гипервизора. А главное — каждый embedding в AWS уже потенциально под юрисдикцией третьих стран. Суверенная инфраструктура — это когда AllowedIPs в WireGuard строго /32, а векторы никогда не покидают датацентр в РФ. Подробнее: https://run-as-daemon.dev/?utm_source=telegram&utm_medium=smm&utm_campaign=rad_ru&utm_content=lokalnye-bazy-vektornyh-embeddingo

Qdrant на собственных серверах с эмбеддингами от BGE-M3 — это не про «он-премис ради он-премис» | Сетка — социальная сеть от hh.ru