Обрабатываем данные эксперимента Make Weak Model Great Again – и некоторые результаты слишком интересные, чтобы ждать финального отчёта.
Начнём с Алисы. Миллионы людей используют YandexGPT каждый день – она бесплатна, встроена в Яндекс Браузер и работает без VPN. В бенчмарке 54 моделей это лучшая российская модель, но до GPT-5.4 ей далеко.
Три главные проблемы: уверенно врёт (признаёт неопределённость в одном ответе из трёх против двух из трёх у GPT), пропускает важное (альтернативные гипотезы, ограничения, оговорки) и даёт размытые рекомендации вместо конкретных.
Зато пишет чистый русский лучше любой иностранной модели.
Мы нашли три техники, которые реально работают:
– XML-шаблон – побеждает обычный промпт в ~85% случаев. Лучшая техника для Алисы из всех десяти – Шаблон ответа – пять строк формата, и модель начинает добавлять секцию «ограничения», о которой раньше молчала. – Ролевое задание – одно предложение перед промптом, и рекомендации становятся конкретнее
А вот мат и КАПС не работают – об этом уже писали.
В статье – готовые шаблоны для каждого уровня и антипаттерны, которых стоит избегать. Например, разбивать задачу на несколько сообщений – плохая идея при контексте в 8К токенов.