База знаний как продукт, а не как свалка PDF

Заметили тренд последнего года? Компании массово прикручивают RAG к корпоративной документации в надежде получить "супермозг" - заливают ворох PDF, поднимают вектор-базу и ждут чуда. По факту получается поисковик, что находит похожие куски текста, но не понимает связей между ними, а главное - внутрь этой конструкции человек зайти не может. Поправил регламент в источнике, но что именно поменялось в ответах бота? Узнаешь постфактум, по жалобам пользователей. Проблема, как мне кажется, не в RAG как решении, а в том, что мы оптимизируем извлечение из набора знаний, который изначально не предназначен ни для машины, ни для человека. Высокотехнологичный поиск по наобум собранной информации на авось, та самая ловушка автоматизации хаоса. Здесь хорошо ложится тезис Андрея Карпати, который он повторяет уже не первый год - хватит пилить фреймворки, идите и вычищайте датасеты. В корпоративном контексте это можно перевести примерно так - перестаньте оптимизировать поиск и начните структурировать сам источник. Под структурированием я имею в виду переход от документов к базе знаний из атомарных заметок с прямыми ссылками. Obsidian как один из вариантов реализации, но тут дело не в инструменте, а в том, что у такой базы есть свойство, которого нет у папки с регламентами - эксперт может зайти внутрь и точечно поправить факт, связь или формулировку и эта правка сразу попадает в контур ответа - следующий запрос к ИИ уже возьмет уточнённую версию. Частое возражение - это же дороже. По токенам - да, контекст из связной базы знаний объёмнее, чем выдранный кусок, но это разумная плата за возможность интерпретации. Можно отследить, откуда пришёл факт, ткнуть пальцем в конкретную заметку и сказать "вот здесь у нас устаревшая формулировка, поэтому бот отвечает так". В свалке PDF этого сделать нельзя - там черный ящик, который молча деградирует с каждым обновлением.  А мы ведь часто сталкиваемся с подобным даже в, казалось бы, привычных форматах ведения документации в Confluence. Прозевали "стык" между двумя спеками и на тесте выплыло, что пограничный процесс посыпался после нашей доработки. А дело-то было в том, что по-отдельности и спецификация по доработке и спецификация с последним стабильным состоянием весьма достоверно смотрятся. Но где-то в коде крутилась недодокументированная процедура, которую доломало наше вмешательство и дальше всё как по нотам - откат, дебаг, разбор полётов, нервы в приёмной и ерзанье на ковре. Но вернёмся к тому, что с такой базой знаний делать дальше. Чистая, связная - идеальный датасет для файнтюнинга небольшой модели под конкретный домен. Тут важно не склеивать сценарии: живая база с RAG даёт обновляемость почти в реальном времени, файнтюн даёт стабильное поведение и экономию в эксплуатации, но момент обучения - финальная точка развития модели и поэтому, чтобы модель знала про изменения, приходится докладывать их через контекст каждого запроса. А чем дальше от точки обучения, тем затрат контекста (да и внимания человека) на ознакомление ассистента с тем, что было "в предыдущем сезоне" больше. Мы даже в бытовом знакомстве с ИИ помним ответ ботов - мои знания актуальны на такую-то дату. Выходит, что подходы даже не конкурируют, это два полюса одной стратегии. На одной чаше - RAG поверх базы знаний, на другой - дообученная модель плюс набор знаний для актуализации. И заметьте, в основе - всегда структура, связность и иерархичность собранной информации. В общем, мой главный тезис - корпоративный ИИ это в первую очередь не задача про метод формирования БД для ассистентов, а задача про культуру работы с источником, взращивание не просто базы знаний, а цельной онтологии со смыслами, связями, иерархией. И именно тут у аналитика появляется неочевидная роль - мы привыкли проектировать структуры данных для различных систем, а теперь приходится проектировать структуры знаний для ассистентов, которые на этих знаниях рассуждают. Дёшево, быстро и без участия человека не получится, качество требует соучастия и концептуального видения. Толмачи с ИИ на пике прогресса должны стать архитекторами смыслов.