4 стратегии чанкинга для RAG 🔪
Представьте: вы загрузили 50-страничный регламент в векторную базу. Пользователь задает конкретный вопрос, ответ на который есть ровно на 25-й странице. Найдет ли его модель?
Не факт. Очень важен правильный выбор стратегии нарезки. Вот короткая шпаргалка по основным:
1️⃣ fixed_size Берет куски строго по N токенов. Режет слова и код посередине. Когда применять: Никогда. Только если ваш документ — сплошной поток текста без абзацев, знаков препинания и смысла.
2️⃣ recursive Пытается разбить текст по пустым строкам, абзацам, точкам. Уважает естественные границы предложений. Когда применять: Техническая документация, код, API-справочники.
3️⃣ semantic Превращает каждое предложение в вектор. Если соседние предложения далеки друг от друга семантически — тема сменилась, пора резать. Когда применять: Транскрипты созвонов, подкасты, диалоги. Вычислительно дорого, но эффективно там, где нет четкой структуры.
4️⃣ document_structure Ищет структуру (заголовки, статьи) и режет строго по ней. Когда применять: Договоры, законы, регламенты.
Чтобы проверить эти стратегии на разных данных, забирайте мой ноутбук на Sponsr. Скрипт тестирует все 4 стратегии разом, строит матрицу и показывает, что работает лучше.
Забрать код (для подписчиков Sponsr!)◀️
А если вы пропустили базу и вообще не понимаете, как скрестить LLM с вашими документами — начните с записи моего эфира по основам RAG.