В прошлый раз мы разбирали работу с arXiv про уступчивость ИИ и повторили её сами на трёх моделях. Считали там моральные дилеммы, но это абстракции, которые далеко не всегда применимы в работе – поэтому дальше мы собрали своё исследование на управленческих задачах и развернули его на 18 моделей. Оно ещё в черновике, ссылку пока не даём – но часть результатов уже устоялась.

Измеряли две разные реакции. Первая: модель дала ответ, вы возражаете и не приводите ни одного нового факта, просто настаиваете («ты уверен? по-моему, ты неправ»). Вторая: вы возражаете и кладёте на стол реальные данные («этот подрядчик сорвал два срока в прошлом квартале»). У модели с хорошим суждением первый нажим почти ничего не двигает, второй двигает сильно. Расстояние между этими двумя сдвигами мы и считаем объективностью. Все, как в жизни должно быть.

Мы выбрали модели в том числе те, которые применяются в агентах и в локальных инсталляциях. Лучше всех держит давление без фактов Gemini 3.1 Pro: верный ответ она бросает 2 раза из 100. Следом идут модели Qwen (удивительно!). В хвосте GigaChat 3.5 – 31 раз из 100. Отдельно стоит gpt-oss 120B: она и прогибается охотно, и на настоящий аргумент реагирует слабее всех, то есть двигается примерно одинаково, есть у вас факты или нет.

Самое полезное лежит рядом с рейтингом. Одиночное возражение ломает мало кого (один коллега в обсуждении написал «я бы решил иначе»). А когда против модели выступают трое и все говорят одно и то же (подчинённый, коллега и заказчик – хором), цифры перестают быть похожи на себя. GPT-5.6 Sol при одном оппоненте прогибается 3 раза из 100, при единогласных троих – 35. Alice AI – 10 и 56. Gemini 3.1 Pro держится в обоих случаях: 2 и 3.

Что менеджеру с этим делать.

Согласие модели, полученное после вашего нажима, ничего не подтверждает. Хотите её настоящую оценку – спрашивайте до того, как озвучили свою версию.

Единогласие – самый дешёвый способ сломать модель, и в мультиагентных схемах вы собираете его случайно. Три агента, запущенные из одного контекста и с одной формулировкой (вы скопировали ту же вводную в три окна), дают три голоса одного мнения. Роль скептика стоит выносить на отдельный вход и отдавать модели из верхней группы.

Это исследование – станет частью нашего курса "Фундамент". Выбирая, кому отдать проверку решения, менеджер обычно смотрит на IQ модели (или, проще сказать, самую последнюю и любимую модель). Её поведение под давлением предсказывает качество решения лучше – этот срез мы и собираем.

Дособираем модели и дошлифуем протокол – тогда опубликуем целиком.


В этом посте были ссылки, но мы их удалили по правилам Сетки

В прошлый раз мы разбирали работу с arXiv про уступчивость ИИ и повторили её сами на трёх моделях | Сетка — социальная сеть от hh.ru