LLM даёт разные ответы на один промпт?

Это не баг, а распределение. «Temperature=0» — это иллюзия! Новое исследование от команды редакторов ведущих экономических журналов развенчивает миф о детерминированности даже при temperature=0. 🔬 Ключевые выводы: Генерация текста — это выбор из вероятностей, а не вычисление, как в калькуляторе. На серверах провайдера влияют: округления чисел, порядок операций, маршрутизация внутри «комитета экспертов» (MoE) и скрытые обновления модели. Даже при одинаковом промпте ответ может «поехать» в сторону из-за микро-шума. 📊 Практический протокол от авторов (для надёжных классификаций): Сделайте не 1, а N запросов (для важных решений — 7–10, для черновиков — 3). Сравните ответы. Возьмите консенсус (моду / медиану) — это отфильтрует случайный шум. Если разброс велик — переформулируйте промпт (проблема в неоднозначности, а не в модели). ⚠️ Ограничения, о которых важно помнить: Метод не спасает от скрытых обновлений модели провайдером (вы буквально общаетесь с другой версией). Не устраняет систематическую ошибку (если модель путает иронию с негативом — усреднение не поможет). Рекомендация: относитесь к ответу LLM как к одному «черпку» из распределения, а не как к истине в последней инстанции. Простое решение для ваших рабочих задач: Задайте один и тот же промпт 5 раз (лучше в новых чатах). Если 3–4 ответа совпадают — доверяйте большинству. Если разброс большой — переформулируйте вопрос, он слишком неоднозначен. 📌 Пример: Отзыв: «Доставили с опозданием, но товар оказался лучше ожиданий». Модель может дать и «нейтральный», и «позитивный» в разных прогонах. Для отчёта из 50 отзывов лучше взять мажоритарный ответ, а не единичный. 🛠 Шаблон, который можно скопировать: «Оцени тональность отзыва: позитивный, нейтральный, негативный. Ответь одним словом. Текст отзыва: …» Повторите 5 раз, соберите ответы и выберите самый частый. Это не заменит профессиональную аналитику, но убережёт от случайных ошибок. arXiv: 2607.24372