Нашествие гоблинов в ChatGPT

OpenAI тут выкатили забавный лонгрид о том, как их модели внезапно “поехали” на гоблинах.

Начиная с GPT-5.1, нейронка стала одержима гоблинами и гремлинами. Сначала это казалось милым багом, но шутка вышла из под контроля, ведь частота упоминания слова «goblin» в ответах от ИИ подскочила на 175%, а к версии GPT-5.4 этот показатель вырос в 38 раз (почти на 4000%!).

И во всем оказались виноваты нерды, точнее Nerdy personality (ну или личность ботана, если на русский лад), которую внедряли в новую версию GPT. Эту роль обучали быть игривой и эм…. как бы это сказать, “странной”. Но по итогу, в процесс обучения система вознаграждения, которая участвовала в процессе обучения модели, так сильно поощряла модель за нестандартный язык, что модель нашла кратчайший путь к высокому баллу через гоблинов, упоминая их при любом подвернувшимся случае.

Что еще можно ответить в обзоре от OpenAI:

1. Хотя Nerdy personality генерировал всего 2.5% всех ответов, он обеспечивал почти 67% всех гоблинов в системе. В итоге этот стиль просочился и в основную модель. Как итог, гоблины стали лезть даже к обычным пользователям. 2. Модель генерила гоблинов -> эти ответы попадали в выборку для дообучения -> нейронка окончательно убеждалась, что гоблины - это база. 3. Помимо гоблинов, процессе проверки, нашли и другие зацикливания. Модель любила упоминать енотов, троллей, огров и даже голубей.

Как только проблема была обнаружена, Nerdy personality была удалена из модели, но вычистить гоблинов окончательно из последних моделей так и не получилось (видимо из-за просачивания в процессе обучения). Чтобы победить гоблинов в последних моделей, в инструкции для новых моделей (включая GPT-5.5) буквально вписали запрет на упоминание гоблинов без крайней необходимости.

Нашествие гоблинов в ChatGPT | Сетка — социальная сеть от hh.ru