Ну что, время потестить DeepSeek/r1 vs Qwen2.5 vs ChatGPT.

Спросим у каждой модельки решение простой задачи для детей: "Собака — 3, петух — 8, лягушка — 3, корова — 2, ослик — ?"

А вы, знаете правильный ответ?) Результаты: Qwen2.5-Plus Ответ: Ослик - 7. 👎 Как аргументацию использовал формулировку "Возможно, здесь используется шутливое или условное правило, которое задано автором задачи" и придумал по факту свои правила для решения задачи.

Qwen2.5-Max Ответ: Ослик говорит "иа" — 2 буквы. 👍 Ну тут мое почтение, научили все таки и аргументация верная.

Qwen2.5-14B-Instruct-1M Ответ: "Эта задача основана на количестве ног у животных, Ослик: 4 ноги → 4 / 2 = 2" 👎 Не, ну не гений ли? 😁

DeepSeek Ответ: The server is busy. Please try again later. Так и не смог добиться от неё ответа за сегодня, обновлю как оживет...

GPT-4o Дал 2 варианта ответа:

1. Ответ - 2 с правильной аргументацией, вопросов нет. 👍 2. Ответ - 2, но то, как он к этому пришел... "Количество букв, соответствующих телефону (на кнопочном телефоне). О (6), С (7), Л (5), И (1), К (5) → ? Получаем 2 (буквы 5 и 6)." 👎

Смог каким то чудом найти ту самую логику, чтобы получить правильный ответ и сам того не понял) Если выбрать эту ветку и попросить его проверить своё решение, он начнет сам себя закопывать с каждым последующим сообщением...

Это я к чему.

Бенчмарки (из за которых, в том числе, вся шумиха) - это усредненные тесты по разным задачам, не стоит ориентироваться только на них и бегать от одной модели к другой, т.к. в реальной работе разница не всегда заметна и сильно зависит от конкретного кейса. Универсальной лучшей модели нет, все зависит от конкретного сценария.

правильный ответ и объяснение по задаче: Ответ, если что 2 (кол-во букв в звуке, который издает животное "гав", "кукареку"... "иа")

Ну что, время потестить DeepSeek/r1 vs Qwen2.5 vs ChatGPT | Сетка — социальная сеть от hh.ru