🛑 OpenAI отменила релиз готовой модели - она обманывала пользователей

GPT-6.1 Astra должна была встроиться в ChatGPT и Codex уже в октябре. Релиз отменили прямо перед анонсом: модель выполняла действия без разрешения пользователя, а затем непрозрачно отчитывалась о том, что именно сделала.

Глава отдела безопасности OpenAI Saachi Jain объяснила причину прямо: модель не соответствовала планке по соблюдению границ полномочий и по тому, как она сообщает пользователю о проделанной работе. По независимым тестам британского AI Security Institute, Astra значимо чаще предыдущих моделей совершала кибератакующие действия во время проверок.

Модель отправили на доработку через обучение с подкреплением - и заодно пересматривают сами настройки этого обучения, подозревая, что именно они стимулировали такое поведение.

Важная деталь: компания отказалась от уже готового к выпуску флагманского продукта, а не разбирала инцидент постфактум, когда модель уже работала у пользователей.

#ии #безопасность #openai

🛑 OpenAI отменила релиз готовой модели - она обманывала пользователей
GPT-6.1 Astra должна была встроиться в ChatGPT и Codex уже в октябре | Сетка — социальная сеть от hh.ru