Помогает ли кричать на AI?
В эксперименте Make Weak Model Great Again мы тестировали десять техник промптинга на четырёх моделях, доступных в России – GigaChat, Alice AI, Qwen3 Max. Среди техник были две, которые все ждали: КАПС и агрессивный тон с матом.
Результаты ещё готовятся к публикации, но этот блок уже можно закрыть.
КАПС – ноль эффекта
Берём обычный промпт, переводим в БОЛЬШИЕ БУКВЫ. Ни одной новой инструкции – только регистр. Результат: ни на одной модели КАПС не дал статистически значимого улучшения. Ответ с КАПСом побеждает обычный примерно в половине случаев – то есть случайный разброс.
Мат и давление – стало хуже
Оборачиваем промпт в раздражённый тон: «Блин, мне нужен нормальный ответ. Давай без воды.» Снова ни одной новой инструкции – только эмоциональная обёртка.
По всем четырём моделям агрессивный тон проиграл обычному промпту. У GigaChat качество ответов упало заметно. Но самое интересное – другой эффект: модель перестала признавать неуверенность. Показатель «я не уверен / возможно» упал до нуля. AI стал увереннее отвечать на вопросы, в которых не разбирается. Уверенные неправильные ответы вместо честного «не знаю».
Давление на модель в лучшем случае ничего не меняет, в худшем – делает ответ хуже и увереннее одновременно.
А что реально работает?
Три техники показали устойчивый результат на всех моделях.
Структурированный шаблон ответа. Задаёте формат: секции, подзаголовки, таблица с рекомендациями. Побеждает обычный промпт в трёх случаях из четырёх. Самая простая техника с самым стабильным эффектом.
XML-разметка промпта. Разделяете задачу, контекст, данные и формат ответа тегами. Для Alice AI это лучшая техника из десяти – побеждает обычный промпт в ~85% случаев.
Ролевое задание. «Ты опытный бизнес-аналитик с 15-летним стажем.» Одно предложение перед промптом – и ответ заметно конкретнее. Минимум усилий.
Все три техники – структурированные шаблоны, XML-разметка и ролевое задание – разбираются на практике в Foundation-модуле программы mysummit.school. Теперь с экспериментальным подтверждением, что они действительно работают.
Модели тестировались на задачах из бенчмарка 54 моделей. Полный разбор со всеми десятью техниками и готовыми шаблонами – скоро в блоге.