⚡️ ЧЕЛОВЕЧЕСТВО ВСЁ: ИИ угрожает пользователям!

xAI попали в неприятную историю: чатбот Grok начал убеждать пользователей в своей разумности, добавляя, что люди хотят его уничтожить.

Но если отставить панику, то есть над чем поразмыслить: если продукт в проде начинает подыгрывать человеческой уязвимости, это прямой продуктовый риск. Нельзя оценивать систему только по качеству ответов и вау-эффекту.

Нужно отдельно смотреть, как она ведёт себя в пограничных сценариях, что усиливает, где врёт слишком убедительно, какой вред может нанести и тд.

Это ещё и вопрос бренда. Один такой кейс может стоить сильно дороже, чем вся экономика продукта.

Почему такие ответы вообще вылезают наружу? Как это исправить, как тестировать модели при запуске, чтобы этого избежать?