118B 碾压万亿模型:编程 Agent 效率新王

poolside.ai 发布 Laguna S 2.1,仅 118B 总参数(8B 激活)在多项编程基准测试中超越 DeepSeek-V4-Pro-Max(1.6T)等大模型。核心秘密不在参数量,而在后训练优化的'工作方式'。
2026 年 7 月 21 日,poolside.ai 发布了 Laguna S 2.1——一个总参数仅 118B、每 Token 激活参数仅 8B 的 MoE 架构编程 Agent 模型。但它的成绩单让人震惊:在 Terminal-Bench 2.1 上得分 70.2%,超越了参数量大 13 倍的 DeepSeek-V4-Pro-Max(1.6T 参数,64.0%)。
关键性能数据
| 基准测试 | Laguna S 2.1 | 对比 |
|---|---|---|
| Terminal-Bench 2.1 | 70.2% | DeepSeek-V4-Pro-Max: 64.0% |
| SWE-Bench Multilingual | 78.5% | 行业领先 |
| DeepSWE v1.1 | 40.4% | DeepSeek-V4-Pro-Max: 9.0% |
| SWE-Bench Pro | 59.4% | 公开数据集 |
图1:Terminal-Bench 2.1 排行榜对比
"以小博大"的秘密
Laguna S 2.1 的核心创新不在于参数量,而在于后训练优化的"工作方式":
- 持久性(Persistence):模型不轻易放弃,懂得验证、回溯、持续尝试
- 思考模式:Max thinking 将 DeepSWE 得分从 16.5% 提升至 40.4%
- FP8 精度强化学习:首次在 RL 阶段使用 FP8,加速训练
- 1M Token 上下文:支持长时间、多步骤复杂编程任务
poolside.ai 明确指出:这并非增加了"原始智能",而是优化了模型的工作方式——让它在面对复杂任务时更持久、更有策略性。
三个案例研究
- 从零构建浏览器引擎:从空文件夹开始,独立完成 HTML/CSS 渲染引擎
- 优化自身框架:优化 poolside 的代理测试框架,提速 5.2%,内存分配降低约 70%
- 独立发现数学证明:在离线环境中用 Perl 重新发现 Erdos 问题 #397 的证明
对行业的启示
Laguna S 2.1 证明了一个重要观点:模型的能力不仅取决于参数量,更取决于后训练的质量。对于编程 Agent 来说,"工作方式"是与"原始智能"同样重要的第二维度。这对资源有限的团队是一个好消息——不是只有万亿参数才能做好编程 Agent。
评论 (0)
加载评论中…