Августовский AI-триплет: веса Qwen 3.8 на HF, релиз DeepSeek V4 Pro и Grok 4.6 🚀 1️⃣ DeepSeek V4 Pro 0813: убиваем конкурентов ценами

Недавно вышла новая крутая Flash версия, теперь получите и распишитесь — релиз DeepSeek V4 Pro 0813.

В бенчмарках творится дичь: — Terminal Bench 2.1: 87.9 (против 85.0 у Opus 4.8). — DeepSWE: выросла с убогих 12.8 в превью сразу до 62.7 (снова обставив Opus 4.8 с его 58.0). — Cybergym: 83.3 (обходит и Opus 4.8 с 78.3, и Fable 5 с 83.1). — AutomationBench: 31.8 [3] (против 27.2 у Opus). — HLE (с тулзами): добирается до 60.0 (у Opus 4.8 — 57.9).

Ценник на OpenRouter: $0.435 за 1M входа / $0.87 за 1M выхода. Модель, которая в консоли, кибербезе и автотестах нахлобучивает топового Клода, стоит буквально копейки. Только вот цены собираются очень сильно повысить 🥲 2️⃣ Qwen 3.8-2.4T-A95B: опенсорс флагман

Недавно я писал про релиз Qwen 3.8-Max, и вот Alibaba сдержала обещание и выложила веса на Hugging Face.

Это огромная MoE-сетка на 2.4 триллиона параметров, из которых при каждом токене активируются 95B (всего 512 экспертов: 10 роутинговых + 1 общий). Нативный контекст — 256K, легко растягивается до 1M.

— Модель исключительно текстовая и работает строго с включенным thinking-режимом. Выключить его нельзя, но глубину рассуждений разрешили рулить параметром reasoning_effort (xhigh, medium, low). — В бенчмарках на кодинг и агентские задачи (SWE-bench, TerminalBench, PaperBench) она умудряется бодаться и местами обходить проприетарные закрытые сетки вроде Opus 4.8 и GPT-5.6 Sol.

3️⃣ Grok 4.6: Ответ от xAI для сложных пайплайнов

И вишенка на торте — релиз Grok 4.6 от Илона Маска.

Здесь фокус сделан на long-running agents, авто-тестирование своего же кода и сборку фронтенда/визуала «с одного промпта»: По бенчмаркам (AA Intelligence Index 61, CursorBench 69.9%) борется с GPT-5.6 Sol Max.

Модель уже завезли в Cursor и Grok Build (на первую неделю дают 2x лимиты). По ценам API — $2 за 1M инпута и $6 за 1M аутпута. По американским меркам неплохо, но на фоне DeepSeek цифры смотрятся бледновато (почти в 7 раз дороже V4 Pro при схожих задачах).

Китайская школа продолжает показывать мастер-класс по захвату рынка: DeepSeek давит инфраструктурной ценой и дикими показателями в бенчах, Alibaba отдаёт топовые веса открытому комьюнити, а американские корпорации продолжают продавать закрытые ручки в сильной переплате.

Августовский AI-триплет: веса Qwen 3.8 на HF, релиз DeepSeek V4 Pro и Grok 4 | Сетка — социальная сеть от hh.ru
Августовский AI-триплет: веса Qwen 3.8 на HF, релиз DeepSeek V4 Pro и Grok 4 | Сетка — социальная сеть от hh.ru Августовский AI-триплет: веса Qwen 3.8 на HF, релиз DeepSeek V4 Pro и Grok 4 | Сетка — социальная сеть от hh.ru