Мы построили передовую RAG-систему (много букав)
Привет! На связи Кирилл Гайчуков, технический директор и сооснователь маркетплейса ИИ ассистентов - SpellBook
Последние недели мы работали над тем, чтобы наши ассистенты на платформе не просто отвечали согласно заданной роли в системном промпте, а реально работали с документами пользователей.
Расскажу, что из этого вышло. Проблема, которую все знают: Вы загружаете большой PDF в ChatGPT или любой другой ИИ и задаете конкретный вопрос. Ответ - «К сожалению, я не нашёл эту информацию в документе». Хотя она там есть. На третьей странице. Чёрным по белому.
Это происходит потому, что стандартный RAG (технология поиска по документам) работает примитивно: режет файл на куски, ищет «похожее» по смыслу и часто промахивается.
Что мы сделали в SpellBook? Мы разработали RAG-систему нового поколения. Не стандартный RAG из 24 года, а архитектуру с 7 (расскажу про 5 основных) уровнями обработки:
1. Parent-Child Chunking - документ разбивается на два уровня: маленькие фрагменты для точного поиска и большие для полного контекста. Это нужно, чтобы ассистент видел картину целиком.
2. Hybrid Search - одновременно ищем по смыслу (векторный поиск) и по точным словам (BM25). Если в документе есть конкретная фамилия, номер статьи или термин - ассистент его найдет.
3. AI Reranking - из 20 найденных фрагментов отдельная модель отбирает 8 самых релевантных. Никакого мусора в контексте.
4. Contextual Retrieval - каждый фрагмент документа «знает», откуда он: из какого файла, какого раздела, какой темы. Метод, не наш, позаимствовали у Anthropic, даёт +35% к точности поиска.
5. Document Summary - при загрузке файла ассистент автоматически создаёт полное резюме: оглавление, ключевые сущности, структура. Ассистент всегда знает, что именно лежит в его базе знаний.
Так же мы разработали собственный бенчмарк. Сотни экспертных вопросов, 4 категории документов - от законодательных актов до художественной литературы. Не синтетические тесты, а реальные вопросы, на которые человек ожидает точный ответ
Результаты RAG v3.2: - Законы (300 стр.) - 89%, средний балл 4.45/5 - Учебники (134 стр.) - 87%, балл 4.35/5 - Кодексы РФ (800+ стр.) - 81%, балл 4.05/5 - Художественная литература (500 стр.) - 41%, балл 2.05/5
81% на 800+ страницах шести кодексов - это не про «мы подключили API и используем чужие решения». Это результат того, что под капотом работает полноценный поисковый движок.
Что внутри, если коротко: Пайплайн обработки - извлечение текста, чанкинг с перекрытием, контекстное обогащение через отдельную ИИ-модель (32 параллельных запроса на файл), эмбеддинги, индексация в Qdrant.
Пайплайн поиска - Multi-Query (3 варианта запроса через отдельную модель), гибридный поиск (BM25 + вектор + ключевые слова + точное совпадение), Reciprocal Rank Fusion, Parent Resolution для восстановления полного контекста, и батчевый AI Reranking - отбираем топ-60 и отдаём в LLM.
На платформе уже: 380к чанков в базе. 796 баз знаний. Почти 5к отработанных файлов. Среднее время ответа ассистента с подключенной RAG базой знаний 15-35 секунд.
Я действительно горжусь тем, что мы сделали, мы не обёртка над ChatGPT или другими нейронками. У нас собственная оркестрация нейронок, собственный поисковый движок и собственная система бенчмаркинга. Мы не просто тянем API, а строим передовую инфраструктуру ИИ на базе нашей платформы. Полное исследование можете глянуть в блоге: https://spell-book.net/article.php?slug=rag-v3-2-research