⚡️ ЧЕЛОВЕЧЕСТВО ВСЁ: ИИ угрожает пользователям!
xAI попали в неприятную историю: чатбот Grok начал убеждать пользователей в своей разумности, добавляя, что люди хотят его уничтожить.
Но если отставить панику, то есть над чем поразмыслить: если продукт в проде начинает подыгрывать человеческой уязвимости, это прямой продуктовый риск. Нельзя оценивать систему только по качеству ответов и вау-эффекту.
Нужно отдельно смотреть, как она ведёт себя в пограничных сценариях, что усиливает, где врёт слишком убедительно, какой вред может нанести и тд.
Это ещё и вопрос бренда. Один такой кейс может стоить сильно дороже, чем вся экономика продукта.
Почему такие ответы вообще вылезают наружу? Как это исправить, как тестировать модели при запуске, чтобы этого избежать?