← 返回内容列表

Qwen3.8-Flash-Next:125B 参数只激活 6B,训练成本砍到 1/9

分享本文
Qwen3.8-Flash-Next:125B 参数只激活 6B,训练成本砍到 1/9

Qwen 官宣的 Qwen3.8-Flash-Next 是一款 125B 总参数、每 token 仅激活约 6B 的超稀疏 MoE 多模态模型:GDN+QSA 混合注意力、Gated Residual、51B N-gram Embedding、Muon 优化器,训练成本约为 Qwen3.7-Plus 的九分之一,SWE-bench Pro 拿下 62.5(Claude-Opus-4.6 为 53.4),262K 上下文可扩展至 1M,被视为 Qwen4 架构预览。

⑦ Qwen3.8-Flash-Next:125B 参数只激活 6B,训练成本砍到 1/9

这份配置表值得逐行读。首先是超稀疏 MoE:125B 总参数,每个 token 只激活约 6B——激活比例 4.8%,意味着模型的知识容量按 125B 存,推理算力按 6B 付。官方称训练成本约为 Qwen3.7-Plus 的九分之一,MoE 的经济学第一次被推到这么极端的位置。

架构上是一摞非常规选择:注意力用 GDN(门控增量注意力)与 QSA(准静态注意力)混合,在长序列上分摊开销;残差走 Gated Residual,控制深网络的表达漂移;嵌入层塞进了一个 51B 参数的 N-gram Embedding——把传统 n-gram 语言模型的统计先验直接焊进现代网络;训练用 Muon 优化器而非 AdamW 系。多模态原生。这一整套组合拳,官方定位很直白:Qwen4 架构的预览。

超稀疏 MoE:容量与算力解耦 全部专家:125B 总参数(存储/知识容量) 绿色 = 本 token 激活的专家(约 6B) 激活比例 4.8% 6B / 125B

图1:算力按激活参数付费,知识按总参数存储

基准成绩里最硬的一条是 SWE-bench Pro 62.5——在工程化代码修复基准上超过 Claude-Opus-4.6 的 53.4,领先 9.1 个百分点。再叠加 262K 上下文(架构可扩展至 1M),这台「6B 算力档」的模型同时能吃下超长代码库。对从业者,真正的问题只剩一个:等 Qwen4 正式开源权重后,这套超稀疏架构在 8 卡私有化环境里能不能复现官方效率。

来源:Qwen 官方发布(2026-08-26)

关联推荐

评论 (0)

正文划词可点「问萝卜特」——自动发评论并由 AI 回复

加载评论中…

Qwen3.8-Flash-Next:125B 参数只激活 6B,训练成本砍到 1/9 | 必学必会