Alibaba показала архитектуру будущего Qwen4
Компания открыла веса Qwen3.8-Flash-Next — мультимодальной модели, которая служит ранним превью архитектуры следующего поколения Qwen4. У неё 125 миллиардов основных параметров и ещё 51 миллиард параметров в N-gram Embedding. Контекст — 262 тысячи токенов и может расширяться примерно до миллиона.
Отдельная N-gram-память хранит представления часто встречающихся сочетаний токенов. Это позволяет добавить модели ещё 51 миллиард параметров почти без увеличения вычислений: нужные значения просто достаются из таблицы, которую можно держать даже вне памяти GPU.
Обучение Qwen3.8-Flash-Next обошлось примерно в девять раз дешевле Qwen3.7-Plus, при этом новая модель оказалась сильнее в программировании и офисных задачах.
Миллион входных токенов стоит 0.16 доллара, выходных — 0.47 доллара.
https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf