Выбор AI-модели обычно обсуждают как рейтинг: кто лучше, кто точнее. На практике полезнее смотреть на другое – как модель ведёт себя, когда данных не хватает. Одна уверенно называет цифру. Другая предупреждает, что цифра зависит от определения рынка. Для менеджера, который готовит решение – это разница между спокойным отчётом и дорогой ошибкой.

Мы прогнали один и тот же запрос через четыре модели – Claude Sonnet 4.5, ChatGPT 5.2, Gemini 2.5 Pro и YandexGPT 5 Pro. Сравнение всех 54 моделей по 8 задачам менеджера – на странице бенчмарка. Задача: подготовить обзор рынка решений для управления проектами – объём, ключевые игроки, барьеры входа. Формулировка одинаковая, контекст одинаковый.

Главное расхождение – не в цифрах, а в отношении к цифрам.

Три модели из четырёх подали числа как факт. Claude: «$7,0 млрд в 2024 году, $10,0 млрд к 2027», таблицей, без оговорок. Gemini и YandexGPT тоже назвали одну оценку каждая. ChatGPT один открыл ответ фразой: «оценки сильно различаются в зависимости от того, что считать рынком – только task-инструменты, enterprise-портфели или управление работой в широком смысле. Разброс у аналитиков доходит до двух раз».

Для презентации на совете директоров это решающая разница. Три ответа выглядят одинаково уверенно, но один из них предупреждает, что цифра – не объективный факт, а выбор методологии.

Короткие характеристики по этому прогону:

Claude выдал таблицу, назвал Мегаплан, Битрикс24 и Pyrus с оценками долей – единственный, кто заметил российских игроков. Читается как отчёт инженера-аналитика.

ChatGPT сразу начал с оговорок и развилок методологии, назвал Planview и ServiceNow в enterprise-сегменте. Читается как методолог, который сначала уточняет задачу.

Gemini дал баланс цифр и пояснений, честно признал, что точные доли – коммерческая тайна. Читается как письмо старшего коллеги, который помогает разобраться.

YandexGPT дал одну цифру с источником (Grand View, 7,5 млрд, CAGR 8,2%), долей конкурентов не назвал, по ключевым вопросам порекомендовал обратиться к аналитическим отчётам. Задача в значительной части вернулась пользователю.

Оговорка важная: это один прогон одного запроса. На другой задаче распределение может оказаться другим. Ценность сравнения – не в том, чтобы выбрать «победителя», а в том, чтобы увидеть, насколько по-разному модели обходятся с неопределённостью при одинаковой постановке.

Для управленческой работы это переводится в простой навык: когда модель уверенно выдаёт число, всегда есть смысл спросить её же – от чего это число зависит и насколько разные оценки существуют у разных аналитиков. Уверенный ответ без этого контекста – самый дорогой режим использования AI.

Разбираем такие сравнения и учим работать с эпистемической неопределённостью моделей на программе mysummit.school – под задачи менеджеров, а не разработчиков.