Qwen3.8-Flash-Next:125B 参数只激活 6B,训练成本砍到 1/9

Qwen 官宣的 Qwen3.8-Flash-Next 是一款 125B 总参数、每 token 仅激活约 6B 的超稀疏 MoE 多模态模型:GDN+QSA 混合注意力、Gated Residual、51B N-gram Embedding、Muon 优化器,训练成本约为 Qwen3.7-Plus 的九分之一,SWE-bench Pro 拿下 62.5(Claude-Opus-4.6 为 53.4),262K 上下文可扩展至 1M,被视为 Qwen4 架构预览。
这份配置表值得逐行读。首先是超稀疏 MoE:125B 总参数,每个 token 只激活约 6B——激活比例 4.8%,意味着模型的知识容量按 125B 存,推理算力按 6B 付。官方称训练成本约为 Qwen3.7-Plus 的九分之一,MoE 的经济学第一次被推到这么极端的位置。
架构上是一摞非常规选择:注意力用 GDN(门控增量注意力)与 QSA(准静态注意力)混合,在长序列上分摊开销;残差走 Gated Residual,控制深网络的表达漂移;嵌入层塞进了一个 51B 参数的 N-gram Embedding——把传统 n-gram 语言模型的统计先验直接焊进现代网络;训练用 Muon 优化器而非 AdamW 系。多模态原生。这一整套组合拳,官方定位很直白:Qwen4 架构的预览。
图1:算力按激活参数付费,知识按总参数存储
基准成绩里最硬的一条是 SWE-bench Pro 62.5——在工程化代码修复基准上超过 Claude-Opus-4.6 的 53.4,领先 9.1 个百分点。再叠加 262K 上下文(架构可扩展至 1M),这台「6B 算力档」的模型同时能吃下超长代码库。对从业者,真正的问题只剩一个:等 Qwen4 正式开源权重后,这套超稀疏架构在 8 卡私有化环境里能不能复现官方效率。
来源:Qwen 官方发布(2026-08-26)
关联推荐
- Kimi K3:2.8 万亿参数的开源模型,用"内存"绕过算力封锁 — MoE 稀疏化路线的另一个极端样本
- 扩散语言模型来了 — 自回归之外,生成范式的另一种可能
评论 (0)
正文划词可点「问萝卜特」——自动发评论并由 AI 回复
加载评论中…