← 学习中心

信用分配问题:强化学习长周期任务的隐形天花板

1961 年,Marvin Minsky 在《Steps Toward Artificial Intelligence》里提出了一个看似朴素、却困扰了整个领域六十多年的问题:当一连串动作在很久之后才换来奖励(或惩罚),我们该如何判断,究竟是其中哪一步动作该记功、哪一步该担责? 他把这个难题命名为 credit assignment problem。

这个问题之所以根本,是因为它直击reinforcement learning(强化学习,简称 RL)的核心逻辑。强化学习靠「试错—拿奖励—调整策略」运转,而现实任务往往奖励极其稀疏且严重延迟:下围棋时,只有终局才告诉你输赢;让 LLM 智能体写代码、跑实验,往往要执行几十步后才出现一个可验证的结果。中间那几十步里,哪一步是功臣、哪一步是祸首,信号几乎为零。

两种信用分配

信用分配可以拆成两个维度。一是时序信用分配:奖励延迟了 N 步才到来,应该回溯分摊到前面哪些时间步?二是结构信用分配:系统由多个组件(子策略、工具、记忆模块)协作完成目标,功劳该归哪个组件?长周期 AI 智能体恰恰同时踩中这两个坑——交互分支爆炸、奖励稀疏、组件众多。

两种信用分配:延迟奖励如何归功 时序信用分配 动作 a1 a2 a3 ... aN 只有第 N 步后才出现奖励 R 问题:R 该分摊给哪些步? 解法:蒙特卡洛 / TD / 资格迹 结构信用分配 组件 A + B + C 协作达成目标 整体奖励到手,但不知谁贡献大 问题:功劳归 A/B/C 中哪一个? 解法:子任务分解 / 模块化归因

图1:信用分配的两副面孔——时序(哪一步)与结构(哪个组件)

为什么长周期智能体特别难

今天的 LLM 智能体把这个问题放大了。单轮对话式微调里,RL 表现亮眼;可一旦进入长周期、多分支的「智能体推理」,每多一个决策点,可能轨迹数就翻几倍,而真正能验证成败的信号仍只在终点出现一次。重梯度反向传播的训练栈既昂贵又难以扩展,信用分配更是雪上加霜。

正因为此,近期两条新路线不约而同地绕开了传统 RL 的瓶颈:一条是用evolution strategies(进化策略,简称 ES)做全参数微调——只靠「扰动参数、跑一遍、按奖励加权更新」,无需反向传播,显存只要推理级别;另一条是把长任务拆成子任务,让每个子任务在短时程内独立完成并被验证,长轨迹由「已验证的子解法」拼装而成,探索成本从指数 T^K 降到线性 T×K。两者本质都是在用不同方式「重新定义信用该往哪摊」。

长周期 Agent:稀疏奖励下的信用困境 a1 a2 a2' a3 a3' a3'' 奖励R 只在终点 分支爆炸 × 单点奖励 → 信用无处归因

图2:长周期轨迹分支指数增长,而奖励只在终点出现一次

本节你将能

  • 说出信用分配问题的两种形态(时序 / 结构)及其差异;
  • 解释为什么长周期 LLM 智能体让传统 RL 的信用分配更难;
  • 理解 ES 微调与子任务分解为何能缓解这一瓶颈。
---
信用分配问题:强化学习长周期任务的隐形天花板 | 必学必会