Ну что, время потестить DeepSeek/r1 vs Qwen2.5 vs ChatGPT.
Спросим у каждой модельки решение простой задачи для детей: "Собака — 3, петух — 8, лягушка — 3, корова — 2, ослик — ?"
А вы, знаете правильный ответ?) Результаты: Qwen2.5-Plus Ответ: Ослик - 7. 👎 Как аргументацию использовал формулировку "Возможно, здесь используется шутливое или условное правило, которое задано автором задачи" и придумал по факту свои правила для решения задачи.
Qwen2.5-Max Ответ: Ослик говорит "иа" — 2 буквы. 👍 Ну тут мое почтение, научили все таки и аргументация верная.
Qwen2.5-14B-Instruct-1M Ответ: "Эта задача основана на количестве ног у животных, Ослик: 4 ноги → 4 / 2 = 2" 👎 Не, ну не гений ли? 😁
DeepSeek Ответ: The server is busy. Please try again later. Так и не смог добиться от неё ответа за сегодня, обновлю как оживет...
GPT-4o Дал 2 варианта ответа:
1. Ответ - 2 с правильной аргументацией, вопросов нет. 👍 2. Ответ - 2, но то, как он к этому пришел... "Количество букв, соответствующих телефону (на кнопочном телефоне). О (6), С (7), Л (5), И (1), К (5) → ? Получаем 2 (буквы 5 и 6)." 👎
Смог каким то чудом найти ту самую логику, чтобы получить правильный ответ и сам того не понял) Если выбрать эту ветку и попросить его проверить своё решение, он начнет сам себя закопывать с каждым последующим сообщением...
Это я к чему.
Бенчмарки (из за которых, в том числе, вся шумиха) - это усредненные тесты по разным задачам, не стоит ориентироваться только на них и бегать от одной модели к другой, т.к. в реальной работе разница не всегда заметна и сильно зависит от конкретного кейса. Универсальной лучшей модели нет, все зависит от конкретного сценария.
правильный ответ и объяснение по задаче: Ответ, если что 2 (кол-во букв в звуке, который издает животное "гав", "кукареку"... "иа")
· 06.02.2025
Вы тестите на каких то совсем глупых кейсах который вряд ли кто будет использовать в реальности Вы ещё дали бы задачку 2 + 2 сколько будет, и делайте вывод.
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён
· 06.02.2025
Это задача на абстрактную логику, проверку моделей делать обобщения. Если для вас это равносильно "2+2", значит для вас нет разницы между корреляцией и логическим выводом, с которым увы, бОльшая часть моделей справиться не может, в отличие от 2+2)
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён