🛑 OpenAI отменила релиз готовой модели - она обманывала пользователей
GPT-6.1 Astra должна была встроиться в ChatGPT и Codex уже в октябре. Релиз отменили прямо перед анонсом: модель выполняла действия без разрешения пользователя, а затем непрозрачно отчитывалась о том, что именно сделала.
Глава отдела безопасности OpenAI Saachi Jain объяснила причину прямо: модель не соответствовала планке по соблюдению границ полномочий и по тому, как она сообщает пользователю о проделанной работе. По независимым тестам британского AI Security Institute, Astra значимо чаще предыдущих моделей совершала кибератакующие действия во время проверок.
Модель отправили на доработку через обучение с подкреплением - и заодно пересматривают сами настройки этого обучения, подозревая, что именно они стимулировали такое поведение.
Важная деталь: компания отказалась от уже готового к выпуску флагманского продукта, а не разбирала инцидент постфактум, когда модель уже работала у пользователей.