Локальные векторные базы — не тренд, а необходимость при работе с регулируемыми данными. Qdrant на собственном сервере (Intel Xeon Silver + 2x8TB NVMe) с моделью BGE-M3 (4-bit AWQ) выдает до 512K векторных операций в секунду при latency p99 < 18 мс. Это в 3.7 раза дешевле Pinecone по TCO на годовой нагрузке 100 млн запросов — без учета скрытых egress-платежей и рисков 152-ФЗ. Все данные остаются внутри контура: эмбеддинги генерируются локально, санитизация PII происходит до этапа индексации, доступ регулируется через внутренний IAM. Никаких /v1/ingest в чужую юрисдикцию. Детали архитектуры, бенчмарки и схема развертывания — в нашем гайде: https://run-as-daemon.dev/?utm_source=telegram&utm_medium=smm&utm_campaign=rad_ru&utm_content=lokalnye-bazy-vektornyh-embeddingo