Google DeepMind обнаружила фундаментальную ошибку в RAG: ограничения эмбеддингов нарушают масштабируемый поиск. Недавнее исследование Google DeepMind выявило фундаментальное ограничение в работе систем Retrieval-Augmented Generation (RAG), которое ставит под сомнение их масштабируемость. Системы RAG, использующие плотные эмбеддинги для представления запросов и документов в многомерном пространстве, оказались неспособны к бесконечному масштабированию. Специалисты Google DeepMind обнаружили, что для эмбеддингов фиксированной размерности существует теоретический предел репрезентационной способности, после которого они не могут эффективно находить релевантную информацию при увеличении объема данных.
Согласно исследованию, для эмбеддингов размером в 512 измерений предел эффективного поиска составляет около 500 000 документов, для 1024 измерений — около 4 миллионов, а для 4096 измерений — до 250 миллионов документов. Важно отметить, что эти цифры представляют собой идеальные оценки, и в реальных условиях ограничения языка приводят к снижению эффективности еще раньше.
Для эмпирической проверки этих выводов был разработан бенчмарк LIMIT (Limitations of Embeddings in Information Retrieval). Тестирование на нем показало, что даже сильные эмбеддеры не достигают высокого показателя recall даже на относительно небольших наборах данных. Например, на LIMIT full (50 000 документов) recall@100 был ниже 20%, а на LIMIT small (46 документов) ни один эмбеддер не достиг полного recall. Это подтверждает, что проблема кроется не только в размере данных, но и в архитектуре одно-векторных эмбеддингов, в отличие от классических лексических моделей вроде BM25, которые не имеют таких ограничений.
Эта проблема имеет серьезное значение для текущих реализаций RAG, поскольку многие предполагают бесконечное масштабирование эмбеддингов с ростом объема данных. Это непосредственно затрагивает корпоративные поисковые системы, работающие с миллионами документов, агентные системы, обрабатывающие сложные запросы, а также задачи по извлечению информации, где динамически определяется релевантность.
В качестве альтернатив одно-векторным эмбеддингам исследователи предлагают рассмотреть кросс-энкодеры, которые обеспечива_ют почти идеал_ьный recall, но с увеличенной задержкой. Также перспективными являются многовекторные модели, такие как C_OLBERT, предлагающие_ более выразительный поиск, и разреженные модели, например BM25 и TF-IDF, которые лучше масштабируются, хотя и уступают в семантической обобщающей способности.
Ключевой вывод исследования Google DeepMind заключается в необходимости архитектурных инноваций, а не просто увеличения размера эмбеддингов. Это означает, что существующие архитектуры RAG-систем не смогут эффективно масштабироваться для работы с очень большими объемами данных, требуя переосмысления архитектурных подходов для обеспечения надежного поиска.
Ссылка на оригинал - https://www.marktechpost.com/2025/09/04/google-deepmind-finds-a-fundamental-bug-in-rag-embedding-limits-break-retrieval-at-scale/