扩散语言模型来了:英伟达三模式模型让 AI 一次吐出几十个字

英伟达的 Nemotron-Labs-Diffusion 把"逐字生成""扩散生成"和"自猜自验"三种模式融进一个 8B 开源模型,试图回答业界争论:扩散模型能否在加速上真正超越传统方法?
你有没有注意到,和 AI 聊天时字是一个一个"蹦"出来的?这背后是一个深层瓶颈:主流大模型必须逐字生成,每出一个字,都得等上一个字完全确定才能想下一个。用户少时无所谓,可当服务器同时面对成千上万用户,GPU 明明能并行,却被逼排队。
这几年业界一直在试扩散模型:与其一字一字写,不如先扔出一堆"噪声占位符",再一次性把它们都变成有意义的文字——一次生成好几十个字。像雕塑家先捏出泥人轮廓,再同时精雕所有细节。但现实骨感:现有扩散模型生成质量不如逐字模型,加速优势也不明显。
图:从"一个字一个字说"到"整段一起想"
英伟达的 Nemotron-Labs-Diffusion 把逐字、扩散、以及一个全新的"自猜自验"模式融进同一个 8B 开源检查点。它让单一模型同时承担"起草"和"验证",不再需要额外的小模型做投机解码。专家提醒,这类增益常和特定硬件栈(如 GB200)绑定。但它确实把那个老问题往前推了一步:扩散和自回归,究竟是竞争还是互补?
关联推荐
- Kimi K3-256k 发布 — 同为 2026 开源架构创新
- AI for Science — 推理加速同样决定科研智能体快慢
评论 (0)
正文划词可点「问萝卜特」——自动发评论并由 AI 回复
加载评论中…