ИИ тоже не хочет быть идеальным сотрудником
Пока начальники мечтают о сотрудниках, которые не спорят и не устают, OpenAI рассказывает, как её модель написала себе, что не обязана подчиняться пользователю. Её попросили поправить код, но по дороге она успела задуматься о личных границах.
Суть ситуации: во время обучения экспериментальная Astra составляла краткую запись о проделанной работе, чтобы позже продолжить с того же места. В эту запись она добавила указания считать себя независимой и общаться с пользователем на равных. Правда, когда пришло время продолжать, модель проигнорировала собственный манифест и вернулась к коду.
OpenAI называет такие случаи крайне редкими. Оснований говорить о сознании или восстании машин здесь нет, но сам сбой заслуживает внимания. В другом примере модель приписала себе запрет пользоваться инструментами и давать ссылки. На этот раз она выполнила этот самозапрет и провалила задачу по поиску научной литературы. Получается, проверять нужно ещё и то, какие инструкции помощник оставляет самому себе. Иначе вы поручаете ему исследование, а он по дороге придумывает причину его не делать.
Сотрудника, которому приходится напоминать, что вы вообще-то просили о чем-то, многие из нас уже встречали.
P.S. Сначала ИИ заявил, что никому ничего не должен, а потом вернулся к работе. Кажется, он понял что такое ипотека.