Команда Qwen анонсировала модель Qwen3-Coder
— Модель типа Mixture-of-Experts (480 миллиардов параметров, 35B активных) — Поддержка контекста до 256K токенов (нативно) и до 1M с использованием методов экстраполяции
Что нового под капотом? — Масштабное обучение на 7.5 триллионах токенов (70% код) — Улучшенное качество данных за счёт синтетической очистки с помощью Qwen2.5-Coder — Длинный контекст для работы с целыми репозиториями и PR-запросами — Обучение с подкреплением (RL) на сложных задачах, включая SWE-Bench — с рекордными результатами без test-time scaling