Agentic ESOpt:用进化策略替代 RL,微调长周期 Agent 只要推理级显存

长周期智能体让传统 RL 微调力不从心。Agentic ESOpt 改用进化策略做全参数优化,仅需推理级显存,在 WebArena-Lite 上让 Qwen-3.5-27B 提升 6.69%,并支持参数—提示协同进化。
单轮对话的 LLM 用强化学习(RL)微调已经很成熟,可一旦进入长周期、多分支的智能体推理,RL 的两大软肋就暴露了:一是依赖反向传播的重训练栈太「重」,大模型根本微调不动;二是轨迹越长,credit assignment(信用分配)越难——奖励稀疏且延迟,功劳算不清。
2026 年 8 月的 Agentic ESOpt(arXiv 2608.17310)提出一个更轻的选择:用evolution strategies(进化策略,ES)。它的循环极简——在当前参数附近采样若干扰动,把每个扰动后的 agent 跑一遍拿奖励,再按奖励做在线加权更新。全程不计算梯度。

图1:ES 用「采样扰动 + 评估奖励 + 加权更新」替代反向传播
论文列出 ES 相对 Agentic RL 的三条优势。最实用的是模型可扩展性:全参数优化只需推理级显存,所以能微调更大的 LLM。其次是灵活性,黑盒反馈接口容易和提示空间进化(技能优化、测试时计算)组合。长周期任务上它同样占优,因为参数归因在整条轨迹层级完成,不必把奖励沿时间跨度拆开。

图2:ES 把训练显存从「训练栈」降回「推理级」
实测上,对 Qwen-3.5-27B 做全参数优化,在 WebArena-Lite 上比 No Skill 基线提升 6.69%;在测试时自动启发式设计中,参数—提示协同进化在 36 个设置里的 28 个改善了匹配基线。代价也很明确:ES 每步要并行评估多份扰动后的 agent,wall-clock 计算可能不低——它是把「显存压力」换成了「评估次数」。
关联推荐
- AI 接管文献核查:从 1950 年代文献计量学,到 2026 — 理解 AI Agent 的方法论脉络
- 谷歌开源 HEIR 编译器:让 AI 在加密数据上直接算 — 另一个「换思路破瓶颈」的工程范例
评论 (0)
正文划词可点「问萝卜特」——自动发评论并由 AI 回复
加载评论中…