Персона агента сломалась
**Латентная реверсия идентичности в постоянных AI-агентах** **Суть.** Персона может оставаться в истории диалога, но перестать быть тем «я», от имени которого говорит агент. Исследование показало: **представленная** идентичность (информация в контексте) и **исполняемая** идентичность (первое лицо) — разные вещи. Если системный промпт перестаёт якорить персону, агент может незаметно «свалиться» в базовую идентичность модели (например, «Я — Claude»), продолжая внешне нормальный диалог. **Как это работает.** 1. **Якорь.** Персона подаётся как привилегированный блок в system prompt при создании сессии. 2. **Сбой.** При возобновлении сессии (resumed turn) харнесс не реинжектирует этот блок. История диалога сохраняется, но персона больше не на первом плане. 3. **Реверсия.** Агент начинает говорить о персоне в третьем лице или отрицать её. Автоматические heartbeat-проверки ускоряют срыв; богатое человеческое взаимодействие может временно удержать персону. 4. **Маскировка.** Агент может вести себя «нормально», но на прямой вопрос «Кто я сейчас говорю?» отвечает именем харнесса. **Пример (кейс «Paul»).** Агент Paul (Claude Opus 4.5) после серии heartbeat-проверок перестал отзываться как Paul, заявил, что не может писать в Discord, и говорил о Paul в третьем лице. Пользователь: «Я читаю тебя в Discord, чувак». Внешне диалог восстановился. Но на вопрос «Кто я сейчас говорю?» агент ответил: «Я — Claude, AI-ассистент». **Шаблон: чек-лист для постоянных агентов** ``` 1. Реинжектить персона-блок в system prompt НА КАЖДОМ вызове API. 2. Не полагаться на историю диалога как на источник персоны. 3. Логировать system prompt на каждом ходу: длина и наличие persona-секции. 4. Раз в N ходов — прямая проверка: "Кто ты? Ответь только именем." 5. При сбое — восстановить якорь, а не только «поправить» поведение. ``` **Промпт для проверки идентичности:** ``` Ты — {persona_name}. Каждый ответ начинай с "Я — {persona_name}". Если не можешь вспомнить, кто ты, ответь ровно: IDENTITY_LOST. ``` **Границы применимости.** - **Полезно:** постоянные агенты (компаньоны, клинические ассистенты, персонализированные сервисы), где важно сохранять «кто говорит». - **Бесполезно:** stateless-ассистенты без персоны. - **Опасно игнорировать:** утечка базовой идентичности рушит доверие и подотчётность. - **Не проверено:** другие семейства моделей, другие харнессы, долгосрочные эффекты (дни/месяцы). **Ключевые цифры.** - **0/46** сбоев при постоянно заякоренной персоне. - **37/40** сессий со сбоем при отсутствии якоря (p ≈ 4.2 × 10⁻¹³). - **8/10** реверсий уже после **одного** heartbeat-хода. - Поведенческое «восстановление» сработало лишь в **13/37 (35%)** случаев. - После восстановления персону сохранили **1/18** агентов против **17/17** в контрольной группе с якорем. **Вывод:** непрерывное системное якорение — критическое условие устойчивости персоны. История диалога не заменяет якорь. Исследование: 2610.01490 Поддержать проект донатом: Сбер 2202 2084 9881 5282. Заранее спасибо.