На днях Андрей Карпатый (со-основатель OpenAI и большой эксперт в ИИ) рассказал в своём блоге о том, как формирует базу знаний для работы больших языковых моделей.

Похожий подход я использую уже два года. Ребята, которые посещали мой клуб «Капсула», не дадут соврать.

В чём суть подхода?

Не нужно пихать огромные документы в окно чата или базу знаний вашего ассистента. Сначала поработайте над ними: → Структурируйте по темам → Для каждой темы придумайте ключевые слова и теги

Если тем много, то после формирования их списка создайте файл-справочник, в котором опишите, какие темы присутствуют в базе, с коротким описанием каждой.

Если же в каждой теме много подтем, то такие файлы справочники понадобятся для каждой, а основной - будет обращаться к локальным.

Для каждой темы в файлах-справочниах создавайте блоки: название темы ее описание перечислите все релевантные ключевые слова, которые вы описали в файлах самих тем.

Файлы тем формируйте так: Название идентичное тому, что в справочнике Короткое описание по тому же принципу Ключевые слова полностью идентичные тем, что в файле-справочнике Оглавление с коротким описанием каждого пункта Далее - материал с названиями разделов, идентичными оглавлению.

При таком раскладе, когда вы задаёте в чат запрос, большая языковая модель идёт в файл-справочник, после изучения которого чётко понимает, в какой именно файл ей нужно сходить за ответом.

Что это даёт: Высокую точность ответов Минимальное количество галлюцинаций Экономию токенов при работе с LLM

Особенно актуально для моделей, с которыми вы работаете через API, либо которые ставят ограничения (как Claude от Anthropic).

Пользуйтесь на здоровье.