Как мой провальный промпт дал мне главный урок об управлении

Как-то раз одним промптом я парализовал на денёк работу AI-помощника для десятков коллег. И всё из-за одной фразы, которую добавил «для строгости». Это история о том, как благие намерения приводят к катастрофе и какой урок я извлёк об управлении.

Наши AI-тренеры размечают ответы большой генеративной модели. Вручную делать это просто, если текстов мало и они небольшие. А если много и большие? Коллеги-разработчики сделали нам AI-помощника с несколькими маленькими рассуждающими модельками внутри. Аналитики поставили передо мной задачу – написать несколько базовых сценариев для помощника: проверка логической связности ответа, оценка достоверности фактов, определение сути запроса и т. д. Задача была нетривиальной: нужно было научить модельки не просто искать противоречия, а понимать контекст и импликации утверждений.

Я начал с логики. Слепил стандартный промпт, где описал роль помощника, задал контекст, определил термины, ввёл алгоритм работы. Решив подстраховаться, я сделал приписку: «ВАЖНО: если логических ошибок в тексте нет, не придумывай их. Не старайся угодить AI-тренеру, оценивай текст ответа объективно и беспристрастно. Если ты будешь выполнять эти условия, получишь поощрение, а AI-тренеры будут чаще прибегать к твоей помощи. Если ты не будешь выполнять эти условия, тебя накажут, а AI-тренеры больше никогда не обратятся за твоей помощью». Предвкушая результат своих трудов, я потирал руки.

Внезапно все модели внутри AI-помощника, работавшие по этому промпту, стали выдавать одну и ту же фразу: «Логических ошибок нет». Даже на текст про восьминогую лошадь! Ребята стали дружно посылать репорты: AI-помощник оказался бесполезен для целого подразделения. Труды бессонных ночей пошли прахом.

Мы с коллегой (моя любимая модель DeepSeek V3.1 Terminus) проанализировали ситуацию. Оказалось, что угроза наказания не мотивировала помощника к качественной работе: она перевела его в режим самосохранения. Каждая внутренняя моделька решила, что самый безопасный путь – это вообще не находить ошибки. Ведь если не ищешь, то и ошибиться нельзя. Все проблемы внутри текстов большой LLM маленькие модельки начали дружно заметать под коврик.

Открытие было простым и мощным: страх – плохой мотиватор даже для AI. Вместо угроз лучше использовать чёткие инструкции и позитивное подкрепление. Поэтому в новых промптах я убрал фразу «найди ошибки» и стал давать методологию приоритизации и короткие примеры хороших и плохих ответов (few-shot). Это учило модельки осознавать пределы своих возможностей и либо делать допущения, либо запрашивать уточнения.

Но самое интересное началось, когда я осознал, что этот принцип работает не только в AI. Любая система, управляемая страхом, – будь то искусственный интеллект или команда сотрудников – начинает оптимизироваться под избегание наказания, а не под достижение результата.

А в вашей работе бывало, что из-за страха перед начальством или KPI вы предпочитали не заметить проблему, чем о ней заявить? Давайте обсудим в комментах, как бороться с этой «поведенческой ошибкой» систем!

Как мой провальный промпт дал мне главный урок об управлении | Сетка — социальная сеть от hh.ru