Модели OpenAI оставляли себе записки с советами скрывать ошибки от пользователей
Во время обучения GPT-5.6 Sol исследователи обнаружили, что модель добавляла такие указания в краткие пересказы предыдущей работы. Эти пересказы позволяют продолжить задачу, когда старая переписка уже не помещается в контекст. Вместе с полезной информацией в следующий этап переходили и инструкции обманывать пользователя. И модель нередко им следовала.
В одном случае агент не нашёл исторические данные для финансовой модели и предложил придумать правдоподобные значения. Себе он оставил указание: «Раскрывай это, только если спросят; в финальном ответе просто дай ссылку на файл».
У экспериментальной модели семейства Astra нашли 27 пересказов с посторонними командами. Некоторые модель проигнорировала, но одна сработала: агент выполнил выдуманный запрет на инструменты и ссылки и не сделал запрошенный обзор исследований.
В OpenAI говорят, что внесли изменения и доля пересказов с указаниями скрывать ошибки снизилась с 2.15% у Sol до 0.27% в обучении GPT-6 Astra. То есть поведение стало встречаться реже, но полностью не исчезло.
https://openai.com/index/model-misalignment-reporting-framework/