"Возможно" по мнению LLM.

Суть Когда ИИ говорит «маловероятно» или «возможно», он имеет в виду не те числа, что вы. Модели правильно расставляют слова по порядку (невозможно < маловероятно < возможно < вероятно < точно) и верно держат края шкалы (0% и 100%). Но есть системный сдвиг: для слов с негативным оттенком модели завышают проценты — там, где человек подумает «10%», модель часто держит «20–25%». А слово «possible» — это лотерея: одна и та же модель в разных запросах понимает его как «10%», а потом как «50%» (у людей, кстати, то же самое). Решение: просите число, а не слово. И просите объяснение перед числом — это снижает разброс ответов у одной модели, но усиливает расхождение между разными моделями. Как это работает Исследователи взяли 11 слов вероятности и проверили их на 19 моделях — от GPT-5 и Claude до Llama-8B. Сравнивали с человеческим эталоном. Выяснилось: Порядок слов модели держат идеально, как люди. Края шкалы («невозможно» → 0, «точно» → 100) — тоже. Середина шкалы — слабое место, особенно слово «possible». Негативные слова модели систематически переводят в числа выше человеческих. Почему так? Модель выучила слова из текстов, где «unlikely» встречается и в контексте «вряд ли дождь», и в контексте «вряд ли конец света». Модель усредняет — отсюда сдвиг. Просьба объяснить работает как принудительная фиксация: модель выбирает одну логическую цепочку и держится её, а не генерирует число заново из облака ассоциаций. Пример применения Ситуация: вы спрашиваете ИИ-помощника о шансах стартапа по доставке продуктов в Москве. ❌ Плохой промпт (без числа): Оцени вероятность успеха этого стартапа: {описание} Модель ответит: «Это маловероятно, учитывая конкуренцию с Яндекс.Лавкой и Самокатом.» Вы не знаете: 5% или 25%? А исследование показывает, что для «маловероятно» модели держат число выше человеческого. ✅ Хороший промпт (с числом и объяснением): Оцени вероятность успеха этого стартапа: {описание} Сначала кратко объясни свои рассуждения по шагам: какие факторы за, какие против. Затем дай финальную оценку — одно число от 0 до 100: 0 = точно провалится 100 = точно взлетит 50 = шансы равны Не используй словесные формулировки в финале — только число. Результат: получаете конкретное число и рассуждение, которое можно сравнить с другими оценками. Шаблон для копирования: Оцени вероятность следующего события: {событие} Сначала распиши рассуждение по шагам: - какие факторы говорят ЗА - какие факторы говорят ПРОТИВ - на какие данные ты опираешься Затем дай финальную оценку в виде ОДНОГО числа от 0 до 100. Шкала: 0 = событие точно не произойдёт 100 = событие точно произойдёт 50 = шансы равны Важно: не используй словесные формулировки («вероятно», «маловероятно») — только число. Границы применимости Метод полезен, когда: вам нужна консистентность одной модели при повторных запросах вы собираетесь сравнивать ответы модели с другими источниками вы принимаете решения, где важна численная оценка риска Метод бесполезен или вреден, когда: вы используете слабые модели (Llama3-8B, Mistral-7B) — у них результат статистически не отличим от случайного угадывания вам нужно сравнивать разные модели между собой — объяснение усиливает их расхождения, а не уменьшает модель начинает оценивать не событие, а то, насколько «естественно выглядит» сам промпт (это реальный случай из исследования) Ключевые выводы Слово «возможно» ненадёжно всегда — даже с числовым форматом модель может колебаться между 10 и 50. Это свойство слова, не баг конкретной модели. Объяснение стабилизирует одну модель, но разводит разные — модели «укрепляются» в своей индивидуальной интерпретации. Круговой тест (число → слово → число) показал пропасть между топ-моделями и слабыми: у GPT-5 и Claude ошибка в разы меньше, чем у Llama-8B, где результат близок к случайности. Для важных решений используйте топовые модели — GPT-5, Claude Opus/Sonnet. arXiv: 2608.26327 Поддержать проект донатом: Сбер 2202 2084 9881 5282. Заранее спасибо.