На днях Андрей Карпатый (со-основатель OpenAI и большой эксперт в ИИ) рассказал в своём блоге о том, как формирует базу знаний для работы больших языковых моделей.
Похожий подход я использую уже два года. Ребята, которые посещали мой клуб «Капсула», не дадут соврать.
В чём суть подхода?
Не нужно пихать огромные документы в окно чата или базу знаний вашего ассистента. Сначала поработайте над ними: → Структурируйте по темам → Для каждой темы придумайте ключевые слова и теги
Если тем много, то после формирования их списка создайте файл-справочник, в котором опишите, какие темы присутствуют в базе, с коротким описанием каждой.
Если же в каждой теме много подтем, то такие файлы справочники понадобятся для каждой, а основной - будет обращаться к локальным.
Для каждой темы в файлах-справочниах создавайте блоки: название темы ее описание перечислите все релевантные ключевые слова, которые вы описали в файлах самих тем.
Файлы тем формируйте так: Название идентичное тому, что в справочнике Короткое описание по тому же принципу Ключевые слова полностью идентичные тем, что в файле-справочнике Оглавление с коротким описанием каждого пункта Далее - материал с названиями разделов, идентичными оглавлению.
При таком раскладе, когда вы задаёте в чат запрос, большая языковая модель идёт в файл-справочник, после изучения которого чётко понимает, в какой именно файл ей нужно сходить за ответом.
Что это даёт: Высокую точность ответов Минимальное количество галлюцинаций Экономию токенов при работе с LLM
Особенно актуально для моделей, с которыми вы работаете через API, либо которые ставят ограничения (как Claude от Anthropic).
Пользуйтесь на здоровье.
· 13.04
Гм, это банальное структурирование информации и по сути принцип рбд. А в чем тогда отличие от поисковика?
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён