RAG SOTA benchmarks

RAG как инструмент подключения базы знаний и обогащения контекста для LLM - это база. Классический пайплайн обычно включает в себя Hybrid Retrieval с разными фильтрациями (BM25 + семантика + другие способы построения ретривала) и хитрым Context Engineering. Все это заправляется реранкером и сжатием контекста через суммаризацию. Еще можно поработать с самим запросом (Step-back prompting), чтобы помочь ретриверу. Можно также добавить агентности, если много времени (с планнингом, инструментами поиска данных и итеративным ретривером).

В твиттере активно продвигалась история с графовыми RAG и PageIndex как альтернатива векторным базам. Вот как раз lightRAG - хитрая история о том, как собрать базу знаний в граф.

Еще, если поискать, по RAG есть интересная статья - RAPTOR. Как некое развитие графовой истории, это про использование дерева с кластеризацией листьев и последующей суммаризацией самой LLM.

Давайте соберем все это вместе, назовем SEQUOIA (раз уж она про деревья) или Semantic-Evolved QUery-Optimized Iterative Abstraction, сделаем свой бенчмарк и посмотрим, как это выстрелит. Да, LLM будет локальная и немного слабоватая, но все равно на тесты я потратил в сумме более 20 часов работы своей машины.

Результаты ошеломляющие 💃: LlamaIndex и LightRAG работают слабо - получается прогрев, а вот наша SEQUOIA - SOTA.

Детали исследования тут https://github.com/Diyago/rag-benchmark/tree/main

RAG SOTA benchmarks
RAG как инструмент подключения базы знаний и обогащения контекста для LLM - это база | Сетка — социальная сеть от hh.ru