IT之家 8 月 26 日消息,阿里通义千问团队于今晚正式推出了 Qwen3.8-Flash。通义团队还公开了 Qwen3.8-Flash-Next 的开源权重,这款 Next 新架构将成为新一代 Qwen4 系列模型的雏形。
这是一款多模态 MoE 模型,主模型拥有 125B 参数,并额外配置了 51B 的 N-gram Embedding,每次 token 激活 6B 参数。它原生支持 262,144 tokens 的上下文长度,且可通过 YaRN 技术扩展到 1M tokens。

据了解,Qwen3.8-Flash 在四个维度上进行了系统性升级:
在 Attention 方面,采用了 GDN(Gated DeltaNet)与 QSA(Qwen Sparse Attention)相结合的混合架构。GDN 负责高效压缩历史信息,QSA 则通过轻量级 Indexer 在 micro-block 粒度上筛选关键上下文,大幅降低长序列的 Attention 开销。面对 1M token 的超长上下文,QSA 的 Attention Kernel 在 Prefill 和 Decode 阶段分别实现了最高 7.6 倍和 4.9 倍的加速。
在 Residual 方面,引入了 Gated Residual(GR)机制,将残差流扩展为 4 条并行分支,并通过动态 Gate 控制信息读写。残差状态支持 FP8 存储,显著降低了访存开销。
在 Embedding 方面,引入了 51B 参数的 N-gram Embedding,利用局部上下文查表来扩充模型容量。这些参数可卸载到 Host Memory,通过异步 Prefetch 与模型计算重叠,不会长期占用 GPU 显存。
在 Optimization 方面,采用了 Muon Optimizer,并针对正交化精度、参数分工及融合矩阵拆分等策略进行了优化。针对新架构重新拟合了 Scaling Law。
性能与成本
与 Qwen3.7-Plus 相比,Qwen3.8-Flash 的训练成本仅为前者的约九分之一,但在编码和办公任务上展现出更强的能力。
在 6B 激活参数下,Qwen3.8-Flash-Next-Base 在 14 个 benchmark 中的 8 个上取得了最优结果,包括 MMLU-Pro、SuperGPQA、BBH、SWEBench-Pretrain、MGSM 与 MMMU。
模型表现
纯文本:

多模态:

模型结构:

Base 模型表现:

可用性与定价
IT之家从官方获悉,Qwen3.8-Flash 即将在千问 AI 平台上线,并对外提供 API 服务,定价为每百万 Tokens 输入 1 元、输出 3 元。
模型权重已于北京时间 8 月 26 日 23:00 在 Hugging Face 与 ModelScope 平台开源,同步发布了 FP8 量化版本。Qwen3.8-Flash-Next 默认支持 1M 上下文并内置官方工具。
参考资料:
- 技术报告:https://github.com/ QwenLM / Qwen3.8-Flash-Next / blob / main / tech_report.pdf
- 技术博客:https://qwen.ai/ blog?id=qwen3.8-flash-next
- **Hugging Face:**https://huggingface.co/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921FsyOPe&file=Qwen3.8-Flash-Next
- **ModelScope:**https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921XAP2dV&file=Qwen3.8-Flash-Next