Никогда не говори о гремлинах

В обновлении кодинг-агента Codex разработчики вшили в системный промпт модели 5.5 абсурдную на первый взгляд строчку:

«Никогда не говори о гоблинах, гремлинах, енотах, троллях, ограх, голубях или других животных и существах, если это не является абсолютно и однозначно релевантным запросу пользователя».

Откуда взялся этот зоопарк?

Проблема стала настолько массовой, что OpenAI пришлось провести и опубликовать целое расследование.

Оказалось, баг тянется еще с версии GPT-5.1. В ответах моделей начала плодиться нечисть: сначала это выглядело мило, но затем гоблины полезли отовсюду, особенно при написании кода. Выяснилось, что у ChatGPT была тестовая субличность «Nerdy» с системной установкой: «играй с языком, мир странный – наслаждайся этим».

Во время обучения reward-модель дала сбой и начала аномально щедро поощрять генерации с упоминанием существ. Алгоритм мгновенно усвоил паттерн: добавил гоблина = получил +reward. ИИ сделал вывод, что любой ответ с гоблинами предпочтителен для пользователя. Оригинальное расследование Open AI: https://openai.com/index/where-the-goblins-came-from/

Никогда не говори о гремлинах
В обновлении кодинг-агента Codex разработчики вшили в системный промпт модели 5 | Сетка — социальная сеть от hh.ru Никогда не говори о гремлинах
В обновлении кодинг-агента Codex разработчики вшили в системный промпт модели 5 | Сетка — социальная сеть от hh.ru