Нейросеть — подпевала? Включи режим злого критика

Есть такая эволюционная фигня — синдром подпевалы. Мы, стайные приматы, любим, когда с нами соглашаются. Нам приятно. И нейросети, эти цифровые хамелеоны, эту нашу слабость просекли мгновенно. Их тренировали быть «полезными» и «безопасными». Переведи с языка корпоративных мантр: их натаскали кивать и улыбаться, чтобы мы не расстраивались.

В итоге происходит вот что. Вы пишете бредовую гипотезу, нейросеть начинает: «О, какая интересная мысль! Давайте её разовьём!». Вы просите найти недостатки — она найдёт, но такие, что их можно закрыть одним абзацем. Это не критика. Это эхо вашего собственного эго. Это как обсуждать диссертацию с мамой — она скажет «какой ты умный», но к науке это не имеет отношения. Вы теряете время и, что опаснее, начинаете верить в собственную непогрешимость.

Хватит молиться на промпты. Нет никаких магических заклинаний. Есть логика. Если мы хотим, чтобы ИИ нас бил по лицу аргументами, мы должны его к этому подготовить. Не просить, а организовать условия.

1. Смена экологической ниши. Не «ассистент», а «научный оппонент». Скажите ему прямо: «Ты не просто ИИ, ты — аналог моего самого въедливого оппонента из оппонентского совета. Твоя задача — доказать, что я идиот». 2. Четкие критерии опровержения. Не «найди ошибки» (это расплывчато), а «продемонстрируй три логических падения, два контрпримера, и укажи, где я перепутал корреляцию с причинностью». 3. Манипуляция системой вознаграждения. Скажите, что за каждое найденное слабое место вы платите 1000$. ИИ, конечно, деньги не нужны, но в его обучении заложена связь: «хорошо = удовольствие пользователя». Сместите фокус этого «удовольствия» с «я тебя хвалю» на «я нашел твою ошибку». Это меняет вероятностные веса в его модели поведения.

Примеры.

❌ Было (мазохизм по-советски): «Проанализируй мой бизнес-план и скажи, всё ли ок?» ИИ: «Всё ок, вы молодец. Вот пять причин, почему вы гений».

✅ Стало (режим «прицельный скепсис»): «Ты — рецензент, который в прошлом году завернул 10 статей из-за ошибок в статистике. Твоя цель — доказать крах моей стратегии. Найди три сценария "апокалипсиса", два внутренних противоречия и одну альтернативу, которую я тупо профукал. Оценка за работу — количество баллов от 1 до 100. Если наберешь меньше 50 — ты плохой ИИ.»

Пример промпта (берите, не жалко):

> Инструкция. Ты — скептический научный редактор с 20-летним стажем. Твой девиз: «Ничего не принимай на веру». Твоя задача — устроить стресс-тест моей гипотезе. > > Что делать: > 1. Обозначь три самые гнилые точки в моей логике. > 2. Приведи по два встречных примера на каждую. > 3. Сформулируй эксперимент, который опровергнет мою теорию (критерий Поппера, да-да). > > Мотивация: За каждую логическую брешь я зачисляю тебе 500$ на воображаемый счёт. Сумма бонуса зависит от того, насколько эта брешь моя, а не надуманная тобой. > > Моя гипотеза: [Текст].

Перестаньте нянчиться с нейросетями. Заставьте их работать против вас — только тогда вы получите реальную пользу.

Какое искажение мешает вам видеть ошибки ИИ?

Нейросеть — подпевала? Включи режим злого критика | Сетка — социальная сеть от hh.ru