← 返回内容列表

118B 碾压万亿模型:编程 Agent 效率新王

118B 碾压万亿模型:编程 Agent 效率新王

poolside.ai 发布 Laguna S 2.1,仅 118B 总参数(8B 激活)在多项编程基准测试中超越 DeepSeek-V4-Pro-Max(1.6T)等大模型。核心秘密不在参数量,而在后训练优化的'工作方式'。

2026 年 7 月 21 日,poolside.ai 发布了 Laguna S 2.1——一个总参数仅 118B、每 Token 激活参数仅 8B 的 MoE 架构编程 Agent 模型。但它的成绩单让人震惊:在 Terminal-Bench 2.1 上得分 70.2%,超越了参数量大 13 倍的 DeepSeek-V4-Pro-Max(1.6T 参数,64.0%)。

关键性能数据

基准测试Laguna S 2.1对比
Terminal-Bench 2.170.2%DeepSeek-V4-Pro-Max: 64.0%
SWE-Bench Multilingual78.5%行业领先
DeepSWE v1.140.4%DeepSeek-V4-Pro-Max: 9.0%
SWE-Bench Pro59.4%公开数据集
Terminal-Bench 2.1 排行榜:参数量 vs 性能 GPT-5.688.8未公开 Kimi K388.32.8T Fable 588.0未公开 Laguna70.2118B-A8B DS-V464.01.6T Nemotron56.4550B 柱高=得分 | 底部=参数量 | Laguna 以 118B 超越 1.6T 的 DeepSeek

图1:Terminal-Bench 2.1 排行榜对比

"以小博大"的秘密

Laguna S 2.1 的核心创新不在于参数量,而在于后训练优化的"工作方式"

  • 持久性(Persistence):模型不轻易放弃,懂得验证、回溯、持续尝试
  • 思考模式:Max thinking 将 DeepSWE 得分从 16.5% 提升至 40.4%
  • FP8 精度强化学习:首次在 RL 阶段使用 FP8,加速训练
  • 1M Token 上下文:支持长时间、多步骤复杂编程任务

poolside.ai 明确指出:这并非增加了"原始智能",而是优化了模型的工作方式——让它在面对复杂任务时更持久、更有策略性。

三个案例研究

  1. 从零构建浏览器引擎:从空文件夹开始,独立完成 HTML/CSS 渲染引擎
  2. 优化自身框架:优化 poolside 的代理测试框架,提速 5.2%,内存分配降低约 70%
  3. 独立发现数学证明:在离线环境中用 Perl 重新发现 Erdos 问题 #397 的证明

对行业的启示

Laguna S 2.1 证明了一个重要观点:模型的能力不仅取决于参数量,更取决于后训练的质量。对于编程 Agent 来说,"工作方式"是与"原始智能"同样重要的第二维度。这对资源有限的团队是一个好消息——不是只有万亿参数才能做好编程 Agent。

[关联推荐]

评论 (0)

加载评论中…