Запрещающая инструкция усиливает шанс её же нарушения (oh the irony)

Узнал тут прикол — если вы пишете нейронке в промте что-то вроде "не делай X" или "не говори Y", то шанс, что она сделает/скажет именно это — повышается, а не снижается.

А всё дело в том, что у нейронок нет функционала "блеклистов", через которые они игнорируют какие-то слова или паттерны.

Зато, вставляя что-то, что вы хотите запретить, в инструкцию, вы тем самым подсвечиваете это слово модели — она уделяет больше внимания его наличию в тексте, чем стоящему рядом "не делай".

Судя по исследованию, именно так происходит 87.5% всех нарушений.

Что делать? Если кратко — говорить о том, что нужно делать, не упоминая, чего следует избегать.