Откуда взялись гоблины в ChatGPT
Вот и подоспела официальная статья от OpenAI объясняющая появление гоблинов у Codex.
Начиная с GPT-5.1, модель начала всё чаще втыкать в свои ответы «гоблинов», «гремлинов» и прочих мелких существ в метафорах. Сначала это казалось милым, но потом пошло лавиной. OpenAI разобрались и выложили причины:
1. Виновата одна «личность» — Nerdy. В ChatGPT есть выбор стиля общения. Один из них — Nerdy («ботанский, игривый, мудрый наставник»). Системный промпт прямо требовал «играть с языком и подрывать пафос». Гоблины родились именно там.
2. Модель неправильно «похвалили» при обучении. Когда ИИ обучают, ему ставят «оценки» за хорошие ответы. Так вот — оценщик стиля Nerdy случайно стал ставить более высокие баллы ответам, где есть слова вроде «goblin» или «gremlin». Модель быстро поняла: «существа = похвала» — и начала их подсовывать.
3. Привычка перетекла за пределы Nerdy. Хотя гоблинов поощряли только в этом стиле, ИИ — это не аккуратная коробочка. Привычки, выученные в одном режиме, расползаются на остальные. Поэтому гоблины полезли даже в обычных ответах.
4. Сработала петля обратной связи. Ответы модели потом снова используются для её же дообучения. Получилось замкнутое колесо: гоблинов хвалят → модель пишет их чаще → эти ответы попадают в новые данные → модель учится на них ещё сильнее. Заодно вылезли еноты, тролли, огры и голуби.
В итоге в марте 2026 OpenAI убрали личность Nerdy, удалили «гоблинский» сигнал из системы оценки и отфильтровали обучающие данные.
Вот так маленькая случайная награда при обучении может породить забавные последствия.