Qwen3.8-Flash-Next дата выхода 2026-08-26 23:00 (UTC+08:00)

Сигнал дошёл до арены по обычным каналам. Тизерная страница ModelScope для Qwen3.8-Flash-Next появилась 25 августа с бейджем «Скоро открытый релиз», слоганом «Вперёд, к новому поколению — молниеносная скорость» и таймером обратного отсчёта до 2026-08-26 23:00 (UTC+08:00). Команда Qwen из Alibaba в тот же день опубликовала пост «Грядёт следующая волна Qwen» Мультимодальная MoE-модель с открытыми весами на архитектуре нового поколения, ранний доступ, чтобы сообщество могло подготовиться к семейству Qwen4. Часть, которую стоит перечитать, — это собственная формулировка Alibaba. Модель описана как построенная на архитектуре следующего поколения, «которая будет питать грядущее семейство Qwen4» — и явно не как сам Qwen4. Заявленная причина Alibaba заключается в том, что архитектурные изменения должны оказаться в руках сообщества до появления семейства, чтобы среды выполнения, квантования и приложения были готовы к моменту выхода настоящего продукта. Это маркетинговая позиция, но также и техническое обязательство: сначала показать сложную часть, взяв сообщество с собой.

Что подтверждено сегодня, а что нет: Подтверждено, согласно тизеру и заявлению Qwen: Qwen3.8-Flash-Next — это модель с открытыми весами, мультимодальная и MoE-модель на архитектуре Qwen4. • Подтверждено, согласно заявлению Qw​en: он представляет два ключевых архитектурных изменения — гибридную архитектуру GDN и разреженное внимание Qw​en (QSA). Подтверждено, согласно тизеру: время релиза — 2026-08-26 23:00 (UTC+08:00), на ModelScope. • Не подтверждено: общее или активное количество параметров, условия лицензии, длина контекста, доступность API и цены, а также все результаты бенчмарков. Независимой оценки пока не существует, поскольку веса ещё не опубликованы.

Что на самом деле представляет собой архитектура Qwen4 Два механизма лежат в основе истории. Первый — GDN, Gated Delta Network, — это слой линейного внимания от Alibaba. Там, где стандартный трансформер хранит кэш ключей и значений, растущий с длиной последовательности, слой GDN поддерживает рекуррентное состояние фиксированного размера и обновляет его по обучаемому правилу стробирования; его родословная идёт через DeltaNet и Mamba-2. Выгода здесь та, что уже тихо обеспечивает работу линейки Qwen начиная с Qwen3-Next: длинные контексты остаются дешёвыми, потому что состояние не растёт, в то время как меньшинство полных слоёв внимания остаётся в смеси для точного извлечения, с которым линейное внимание справляется плохо. В текущем поколении эта смесь работает примерно в пропорции три слоя GDN на один полный слой внимания — анализ чекпойнта Qwen3.8-2.4T-A95B сообществом насчитывает 69 слоёв GDN против 23 слоёв внимания. Qwen3.8-Flash-Next описывается как «гибридная архитектура GDN» именно на этой линии. Второй — QSA, он же Qw​en Sparse Attention, — по-настоящему новый компонент, и публичного технического описания его пока нет: только название и позиционирование как одного из двух главных изменений превью. Само отсутствие деталей — часть той же картины. Превью Qwen3-Next в конце 2025 года представило Gated DeltaNet с таким же дефицитом документации, и архитектура получила полное описание только после того, как её переняла серия Qw​en3.5. Для читателя практический вывод оба раза один и тот же: сначала появляется канарейка архитектуры, а документация и продакшн-модели — после.

Чего мы до сих пор не знаем Уровень «Flash». В поколении Qw​en3.5 доступная только в облаке модель Qwen3.5-Flash была улучшенным вариантом модели Qwen3.5-35B-A3B с открытыми весами. Является ли Qwen3.8-Flash-Next открытым аналогом модели Qw​en3.8 аналогичного размера, неизвестно; возможно, это модель класса 125B-A6B. Обе интерпретации — лишь догадки. Бенчмарки. В заявлении Qwen подчёркиваются агентное программирование, долгосрочные задачи и мультимодальный интеллект, но никаких цифр не приводится, и независимой оценки не будет до выхода весов.

Qwen3.8-Flash-Next дата выхода 2026-08-26 23:00 (UTC+08:00) | Сетка — социальная сеть от hh.ru