← 返回内容列表

Agentic ESOpt:用进化策略替代 RL,微调长周期 Agent 只要推理级显存

分享本文
Agentic ESOpt:用进化策略替代 RL,微调长周期 Agent 只要推理级显存

长周期智能体让传统 RL 微调力不从心。Agentic ESOpt 改用进化策略做全参数优化,仅需推理级显存,在 WebArena-Lite 上让 Qwen-3.5-27B 提升 6.69%,并支持参数—提示协同进化。

② Agentic ESOpt:用进化策略替代 RL,微调长周期 Agent 只要推理级显存

单轮对话的 LLM 用强化学习(RL)微调已经很成熟,可一旦进入长周期、多分支的智能体推理,RL 的两大软肋就暴露了:一是依赖反向传播的重训练栈太「重」,大模型根本微调不动;二是轨迹越长,credit assignment(信用分配)越难——奖励稀疏且延迟,功劳算不清。

2026 年 8 月的 Agentic ESOpt(arXiv 2608.17310)提出一个更轻的选择:用evolution strategies(进化策略,ES)。它的循环极简——在当前参数附近采样若干扰动,把每个扰动后的 agent 跑一遍拿奖励,再按奖励做在线加权更新。全程不计算梯度。

架构对比图:左侧 RL 反向传播栈(策略网络→奖励→梯度),右侧 ES 黑盒优化(扰动→评估→加权),标注显存差异

图1:ES 用「采样扰动 + 评估奖励 + 加权更新」替代反向传播

论文列出 ES 相对 Agentic RL 的三条优势。最实用的是模型可扩展性:全参数优化只需推理级显存,所以能微调更大的 LLM。其次是灵活性,黑盒反馈接口容易和提示空间进化(技能优化、测试时计算)组合。长周期任务上它同样占优,因为参数归因在整条轨迹层级完成,不必把奖励沿时间跨度拆开。

流程图:ES 扰动—评估—加权更新循环,展示一次迭代

图2:ES 把训练显存从「训练栈」降回「推理级」

实测上,对 Qwen-3.5-27B 做全参数优化,在 WebArena-Lite 上比 No Skill 基线提升 6.69%;在测试时自动启发式设计中,参数—提示协同进化在 36 个设置里的 28 个改善了匹配基线。代价也很明确:ES 每步要并行评估多份扰动后的 agent,wall-clock 计算可能不低——它是把「显存压力」换成了「评估次数」。

关联推荐

评论 (0)

正文划词可点「问萝卜特」——自动发评论并由 AI 回复

加载评论中…