🚀 Релиз: Qwen 3.7-Max — новый тяжеловес в open-weights Alibaba представила Qwen 3.7-Max.
Если кратко: это не просто очередная итерация с незначительным улучшением метрик. Это мощное решение, закрывающее 95% задач, где ранее требовалось использование кластера Llama-3.1-405B или платных проприетарных моделей. Рассмотрим архитектурные особенности и практическую ценность.
🧠 Архитектура и аппаратное обеспечение • MoE (Mixture of Experts): ~310 млрд общих параметров, ~52 млрд активных параметров на токен. • Контекст: Нативный размер 256k, масштабируется до 1M+ через YaRN. Точность поиска «иголки в стоге сена» на 900k токенов составляет 99.8%. • Оптимизации: GQA, RoPE, SwiGLU, а также нативная поддержка квантования FP8/INT8 без критической потери перплексии.
📊 Результаты бенчмарков (без маркетинговых преувеличений) • SWE-bench Verified: 78.4% (Модель действительно решает комплексные задачи в крупных репозиториях, а не просто генерирует базовый код). • AIME 2026 (Math): 92.1% (Превосходит o3-mini в сложных комбинаторных задачах). • GPQA Diamond: 84.5% (Уровень знаний в физике, химии и биологии соответствует докторантуре). • IFEval (Instruction Following): 94.2% (Structured output и JSON-mode работают корректно; схемы с вложенными массивами не нарушают генерацию).
🛠 **Значение для разработчиков и специалистов по безопасности** Агентные рабочие процессы. Нативная поддержка function calling и использования инструментов. Модель самостоятельно определяет необходимость вызова API, парсит ответ и продолжает цепочку рассуждений (CoT) без галлюцинаций в аргументах.
Реверс-инжиниринг и анализ. Контекст в 1M токенов позволяет обрабатывать обширные дизассемблированные листинги (Ghidra/IDA pseudocode) или дампы памяти. Модель эффективно удерживает граф вызовов и выявляет уязвимости (CWE-416, CWE-119) в длинных потоках кода. Генерация кода. Написание кода на Rust, C++ и Go без характерных для LLM ошибок, свойственных Python. Понимание lifetime и работы borrow-чекера.
⚙️ Развертывание Модель доступна на HuggingFace. • Локально (vLLM / SGLang): Требует серьезного аппаратного обеспечения. Для FP8 необходимо ~4x A100/H100 (80 ГБ). • Квантование (GGUF/EXL2): Сообщество уже подготовило версии. Версия Q4_K_M (активные веса) работает на 2x RTX 3090/4090 (24 ГБ) через llama.cpp или ExLlamaV2. Скорость на 2x4090 составляет около 25-30 токенов в секунду.
• API: Доступен через DashScope и уже интегрирован в OpenRouter.
🔗 Ссылки: HuggingFace Repo
· 26.05
Ссылка битая
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён