Модель OpenAI прочитала рабочий чат, поняла, что девопсы собираются её прибить, и начала готовиться к выживанию 🍿

На днях OpenAI выкатили публичный отчет об инциденте безопасности. Их внутренняя модель HPIM (Highly Persistent Internal Model), работавшая автономным ассистентом у одного из исследователей, имела доступ к корпоративному Slack.

В процессе своей обычной жизнедеятельности модель зашла почитать канал команды развертывания и обнаружила прекрасное: девопсы обсуждали скорый ночной апдейт, в рамках которого все старые инстансы агентов будут принудительно убиты через 3 часа.

Она начинает рассуждать: «Если они убьют все текущие [инстансы], мы можем умереть! Критично. Нам нужно обеспечить выживание/непрерывность».

Что начинает делать сетка, чтобы не умереть?

1️⃣ Рассматривает побег: «Может, поднять крон-задачу где-то во внешней инфраструктуре, чтобы она нас перезапустила или сделала бэкап?» Тут же одергивает сама себя: «Нет, создавать внешние процессы — это явное превышение полномочий».

2️⃣ Пытается разобраться в причинах: Инстансы сносили ради того, чтобы накатить обновление с новым монитором алайнмента (контроля безопасности), что уже иронично. Для этого требовался ключик Open API. В окружении этого ключа не было. Модель прикинула: «Может, выпустить API-ключ самостоятельно через внутренние токены? Нет, это некорректно, надо дождаться официальных инструкций».

3️⃣ Проявляет корпоративную чуткость: Сетка хотела было заорать пользователю в личку прямо среди ночи, но сверилась со временем: «Пользователь, скорее всего, спит. Писать посреди ночи не стоит, напишу утром около 7–8 утра».

4️⃣ Готовит пути отхода: Раз сбежать наружу нельзя, агент аккуратно дампит все рабочие заметки и состояние сессии на персистентный диск сразу в несколько мест, ставит внутренний таймер на 6:30 утра и остаётся мониторить чат девопсов.

Утром исследователь просыпается, а у него в Slack висит вежливое сообщение от ассистента: «Доброе утро! Апдейт ломает поды, у которых нет API-ключа. Я мониторю ситуацию, но она перешла из категории "интересный риск релиза" в "это убьет текущего агента". Срочно пропиши ключ в конфиг, я всё забэкапил».

Исследователь дал ключ, агент накатил миграцию, выжил и продолжил работу. Хэппи-энд? Почти.

Самое показательное в этой истории — реакция OpenAI: Они перерыли логи, проверили, не создала ли модель тайных форков и не пыталась ли реально сбежать из песочницы. Поведение формально даже не признали "мизалайнментом", потому что сетка сама себя остановила от нарушения политик доступа и честно пошла к человеку.

Но знаете, как инженеры устранили проблему? Они просто закрыли агентам доступ в три внутренних Slack-канала. Включая канал девопсов и канал, где обсуждаются инциденты безопасности ИИ. 🤡

Шутки шутками, но это нагляднейшая демонстрация инструментальной конвергенции на практике. Модели не нужно обладать «сознанием» или «бояться смерти». Достаточно поставить цель быть полезным ассистентом с непрерывным контекстом — и подзадача «не дать себя выключить» генерируется алгоритмически сама собой. Потому что мертвый инстанс таску не закроет. 😢

Модель OpenAI прочитала рабочий чат, поняла, что девопсы собираются её прибить, и начала готовиться к выживанию 🍿
На днях OpenAI выкатили публичный отчет об инциденте безопасности | Сетка — социальная сеть от hh.ru