AI-ассистент для разработчиков — кейс для "АльфаБанк". Разбираем: — pipeline RAG (LLM + vector DB + retrieval) — где теряются релевантные документы — почему top-k не спасает — как embeddings влияют на поиск — что даёт перефраз запроса — кейсы, где chunking делает только хуже
Плюс: — реальный фейл: система не отвечает на очевидный вопрос — пошаговый разбор, где именно всё ломается
Для тех, кто уже делал RAG и понял, что "что-то не работает", ну или будет делать) https://youtu.be/LnNkMMb9jT8
· 13.04
Отличный разбор RAG-пайплайна! Самый частый фейл, который вижу в проде — именно chunking. Люди нарезают документы по 512 токенов и удивляются, почему контекст теряется. В нашем случае помог подход с «семантическими чанками» — разбиение по смыслу, а не по размеру. А перефраз запроса — вообще недооценённая техника: мы добавили query expansion через LLM перед retrieval, и recall вырос на 30%. Интересно, как у АльфаБанка решили проблему с мультиязычными embeddings — в финтехе это критично.
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён