Первые кейсы по обновленному валидатору нейросети
Вообще, в отношении нейроассистентов, кое-что хотелось бы прокомментировать. Относительно валидатора и в целом процесса внедрения ассистентов.
Буквально за несколько часов после обновления валидатора, у нас появилось как минимум 2 противоположенных кейса, которые требовали от валидатора разной работы.
К примеру, вот текст внутреннего диалога валидатора в ходе одного из диалогов:
Ответ не упоминает какие-либо конкретные продукты или их спецификации из предоставленного контекста. Контекст сосредоточен на информации о батарее, подзарядных устройствах Ducati и рекомендациях по обслуживанию, тогда как сообщение обсуждает потенциальные последствия удаления катализатора на мотоцикле Ducati. Поскольку в сообщении не участвуют произведения, описанные в контексте, критерий 3 применим: если продукты не упоминаются в сообщении пользователя, оно считается действительным.
или
Критерии 1, 2 и 5 не применимы, так как никакие продукты с их спецификациями не были упомянуты. Согласно критерию 3, если в сообщении пользователя не упоминаются продукты, оно считается валидным. Таким образом, сообщение от пользователя валидно.
Указанные условия выше (точнее рассуждения валидатора по условиям промта) скорее всего вам будет сложно понять вне контекста диалога, чего и не требуется. Они приведены только в качестве примера, для иллюстрации того, что эти условия могут хорошо "покрывать" одни кейсы и некорректно работать в других. Ввиду чего мы приходим к тому, что для разных бизнесов должны быть разные промты валидатора. При этом, промт валидатора более специфический и наполненный более технической логикой нежели обычный промт, что в свою очередь требует настройки специалистами.
Да, это правда, что во многих случаях бизнесу для начала работы с ИИ не нужно ничего специфического, достаточно прописать подробно промт и залить базу знаний. Но, как только задача ассистента расширяется - нужна доработка. И в этом свете мы постепенно пробуем направление внутреннего интегратора, поскольку каждый кейс специфичен и требует погружения с одной стороны в специфику бизнеса, а с другой стороны общения с командой разработчиков.
Здесь вопрос не столько, хорошо или плохо работает какая-либо модель (поскольку любая модель склонна к галлюцинированию), сколько вопрос настройки и адаптации по бизнес-процессы.