Неделю назад выкладывали обновлённый бенчмарк ИИ для менеджерских задач. Главный вопрос, который задали читатели: «Рейтинг видел, но мне-то какую выбрать под мои задачи?»

Добавили страницу сравнения двух моделей бок о бок: https://mysummit.school/research/benchmark/compare/ Зачем это нужно

Усреднённый рейтинг скрывает специализацию. Модель на 3-м месте общего зачёта вполне может быть на 1-м в «анализе данных» и на 15-м в «коммуникации». Если ваши задачи – писать клиентам и собирать отчёты, общая «тройка» ничего вам не говорит.

Сравнение показывает разницу по 8 категориям: поиск информации, коммуникация, анализ и решения, планирование, решение проблем, обучение и развитие, работа с командой, региональный контекст для русскоязычных кейсов.

Сценарии, где это пригодится

Перед оплатой подписки. Выбор между ChatGPT Plus и Claude Pro – сравнение GPT 5 и Sonnet 4.6 показывает, в каких категориях разница реальна, а где модели идут вровень и переплата не оправдана.

При обновлении версии. Вышел Opus 4.7 или Gemini 3 Pro – интересно понять, что именно изменилось относительно той модели, которой уже пользуетесь. Часто «прирост» концентрируется в кодинге, а в работе с текстом всё на месте или хуже.

Закупка для команды. По категории «региональный контекст» сразу видно, какие модели нормально работают с русскоязычными управленческими кейсами, а какие отвечают калькой с английского и путаются в локальных реалиях.

Ограничения по доступу. В карточке каждой модели – доступность из России без VPN, цена в рублях через локальных провайдеров, способ оплаты картой.

Как устроено

Два дропдауна с моделями => паутинка с двумя контурами по 8 осям => таблица разницы по категориям => разбивка по подкритериям внутри каждой (в «коммуникации» это тон, эмпатия, структура, культурный контекст).

Бенчмарк живой – модели добавляются по мере выхода


В этом посте были ссылки, но мы их удалили по правилам Сетки

Неделю назад выкладывали обновлённый бенчмарк ИИ для менеджерских задач | Сетка — социальная сеть от hh.ru