Никогда не говори о гремлинах
В обновлении кодинг-агента Codex разработчики вшили в системный промпт модели 5.5 абсурдную на первый взгляд строчку:
«Никогда не говори о гоблинах, гремлинах, енотах, троллях, ограх, голубях или других животных и существах, если это не является абсолютно и однозначно релевантным запросу пользователя».
Откуда взялся этот зоопарк?
Проблема стала настолько массовой, что OpenAI пришлось провести и опубликовать целое расследование.
Оказалось, баг тянется еще с версии GPT-5.1. В ответах моделей начала плодиться нечисть: сначала это выглядело мило, но затем гоблины полезли отовсюду, особенно при написании кода. Выяснилось, что у ChatGPT была тестовая субличность «Nerdy» с системной установкой: «играй с языком, мир странный – наслаждайся этим».
Во время обучения reward-модель дала сбой и начала аномально щедро поощрять генерации с упоминанием существ. Алгоритм мгновенно усвоил паттерн: добавил гоблина = получил +reward. ИИ сделал вывод, что любой ответ с гоблинами предпочтителен для пользователя. Оригинальное расследование Open AI: https://openai.com/index/where-the-goblins-came-from/