За выходные мы обновили наш бенчмарк

Крупные изменения в методологии: • Мы ее уточнили по обратной связи, поэтому прошлая версия (v1) не сравнима с новой (v2). Методику расчета изменили, увеличили количество тестовых промптов для проверки (раньше было 4, теперь 10 на категорию) • Мы уменьшили количество моделей, которые участвуют в рейтинге – нет смысл смотреть 50 моделей, 40 из которых редко используются :) • Добавится (еще) попарное сравнение каждой модели, что позволит ответить на вопрос – какая модель лучше для моей задачи • Нет мест, теперь категории – элитные, выше среднего и т.д. Это сделано, поскольку в целом модели равны по мощности и 0.5 единиц разницы – не имеет значения для выбора. Поэтому, выбирать любую модель из пуля

Изменения в рейтинги и неожиданные вещи! • Opus 4.6 лучше Opus 4.7. Новая модель не значит лучше для ваших задач • MiMo v2.5 Pro – новый лидер среди китайских моделей! Наравне с Kimi K2.6 • Gemini 3.1 Pro – в середничках. А мы использовали его, как судью – пора делать выводы и менять судей • Стандартный GPT 5.5 – все еще лучше, даже без Pro (который стоит 200 долларов в месяц). • Новые модели DeepSeek'a – поднялись в рейтинге и в категории сильных моделей • российские модели (GigaChat, Yandex) – все еще внизу рейтинга. Не знаю, что им может помочь

А в целом – все это отражается в программе нашей школы и рекомендациях для наших студентов.

За выходные мы обновили наш бенчмарк
Крупные изменения в методологии:
• Мы ее уточнили по обратной связи, поэтому прошлая версия (v1) не сравнима с новой (v2) | Сетка — социальная сеть от hh.ru