ТРЕТИЙ УДАР КИТАЙСКОГО МОЛОТА 🔨
Qwen выкатывает модели быстрее, чем я успеваю писать посты.
Сначала было обновление универсального Instruct. Потом узкоспециализированный Coder. Теперь улучшают мышление.
Встречайте, Qwen3-235B-A22B-Thinking-2507. Это продолжение стратегии работы над узкоспециализированными инструментами для конкретных доменов.
Что по результатам? Они снова на вершине, но теперь в самых престижных номинациях:
🧠 Математика и логика: На бенчмарке HMMT25 (олимпиада по математике) она рвёт всех, включая GPT-4o и Gemini 2.5 Pro. На AIME25 дышит в спину самой мощной версии OpenAI.
💻 Программирование: Снова топ-1 на LiveCodeBench. 74.1 балла против 72.5 у Gemini и 71.8 у GPT-4o-mini.
Как? Они буквально заставляют модель «думать на бумаге» через специальный тег , где она прописывает всю цепочку рассуждений перед выдачей ответа.
🔥 Как из неё выжать максимум (советы от разрабов): ▫️ Для сложных задач (код, математика) ставьте max_new_tokens не меньше 81,920. Модели нужно место, чтобы «подумать». ▫️ Используйте Temperature=0.6, TopP=0.95.
Китайцы не просто догнали, а в самых сложных интеллектуальных задачах начали обгонять. И всё это в опенсорсе.
Погонять бесплатно тут: https://chat.qwen.ai/ Веса на Hugging Face: https://huggingface.co/Qwen/Qwen3-235B-A22B-Thinking-2507
____ В этом посте были ссылки, но мы их удалили по правилам Сетки