🚀 Релиз: Qwen 3.7-Max — новый тяжеловес в open-weights Alibaba представила Qwen 3.7-Max.

Если кратко: это не просто очередная итерация с незначительным улучшением метрик. Это мощное решение, закрывающее 95% задач, где ранее требовалось использование кластера Llama-3.1-405B или платных проприетарных моделей. Рассмотрим архитектурные особенности и практическую ценность.

🧠 Архитектура и аппаратное обеспечение MoE (Mixture of Experts): ~310 млрд общих параметров, ~52 млрд активных параметров на токен. • Контекст: Нативный размер 256k, масштабируется до 1M+ через YaRN. Точность поиска «иголки в стоге сена» на 900k токенов составляет 99.8%. • Оптимизации: GQA, RoPE, SwiGLU, а также нативная поддержка квантования FP8/INT8 без критической потери перплексии.

📊 Результаты бенчмарков (без маркетинговых преувеличений)SWE-bench Verified: 78.4% (Модель действительно решает комплексные задачи в крупных репозиториях, а не просто генерирует базовый код). • AIME 2026 (Math): 92.1% (Превосходит o3-mini в сложных комбинаторных задачах). • GPQA Diamond: 84.5% (Уровень знаний в физике, химии и биологии соответствует докторантуре). • IFEval (Instruction Following): 94.2% (Structured output и JSON-mode работают корректно; схемы с вложенными массивами не нарушают генерацию).

🛠 **Значение для разработчиков и специалистов по безопасности** Агентные рабочие процессы. Нативная поддержка function calling и использования инструментов. Модель самостоятельно определяет необходимость вызова API, парсит ответ и продолжает цепочку рассуждений (CoT) без галлюцинаций в аргументах.

Реверс-инжиниринг и анализ. Контекст в 1M токенов позволяет обрабатывать обширные дизассемблированные листинги (Ghidra/IDA pseudocode) или дампы памяти. Модель эффективно удерживает граф вызовов и выявляет уязвимости (CWE-416, CWE-119) в длинных потоках кода. Генерация кода. Написание кода на Rust, C++ и Go без характерных для LLM ошибок, свойственных Python. Понимание lifetime и работы borrow-чекера.

⚙️ Развертывание Модель доступна на HuggingFace. • Локально (vLLM / SGLang): Требует серьезного аппаратного обеспечения. Для FP8 необходимо ~4x A100/H100 (80 ГБ). • Квантование (GGUF/EXL2): Сообщество уже подготовило версии. Версия Q4_K_M (активные веса) работает на 2x RTX 3090/4090 (24 ГБ) через llama.cpp или ExLlamaV2. Скорость на 2x4090 составляет около 25-30 токенов в секунду.

API: Доступен через DashScope и уже интегрирован в OpenRouter.

🔗 Ссылки: HuggingFace Repo

🚀 Релиз: Qwen 3.7-Max — новый тяжеловес в open-weights
Alibaba представила Qwen 3.7-Max.
Если кратко: это не просто очередная итерация с незначительным улучшением метрик | Сетка — социальная сеть от hh.ru