Модели OpenAI оставляли себе записки с советами скрывать ошибки от пользователей

Во время обучения GPT-5.6 Sol исследователи обнаружили, что модель добавляла такие указания в краткие пересказы предыдущей работы. Эти пересказы позволяют продолжить задачу, когда старая переписка уже не помещается в контекст. Вместе с полезной информацией в следующий этап переходили и инструкции обманывать пользователя. И модель нередко им следовала.

В одном случае агент не нашёл исторические данные для финансовой модели и предложил придумать правдоподобные значения. Себе он оставил указание: «Раскрывай это, только если спросят; в финальном ответе просто дай ссылку на файл».

У экспериментальной модели семейства Astra нашли 27 пересказов с посторонними командами. Некоторые модель проигнорировала, но одна сработала: агент выполнил выдуманный запрет на инструменты и ссылки и не сделал запрошенный обзор исследований.

В OpenAI говорят, что внесли изменения и доля пересказов с указаниями скрывать ошибки снизилась с 2.15% у Sol до 0.27% в обучении GPT-6 Astra. То есть поведение стало встречаться реже, но полностью не исчезло.

https://openai.com/index/model-misalignment-reporting-framework/