OpenAI остановила обучение новых моделей из-за рисков

Компания на две недели поставила на паузу RL-обучение последних моделей, готовящихся к релизу. Самый крупный запланированный прогон до сих пор не запущен. Сначала OpenAI хочет убедиться, что новые системы контроля действительно работают.

По предварительным тестам модель Astra, уже достигла критического уровня кибервозможностей. Потенциально она способна самостоятельно проводить очень сложные атаки.

Теперь для всех моделей уровня Sol и выше при работе с инструментами система анализирует их действия и рассуждения практически в реальном времени. Если происходит что-то подозрительное, команда должна разобраться с этим максимум за 30 минут, иначе эксперимент останавливают. На такой контроль уходит ещё около 20% вычислительных ресурсов поверх самого инференса.

https://openai.com/index/pacing-model-development-cyber-capabilities/