信用分配问题:强化学习长周期任务的隐形天花板
1961 年,Marvin Minsky 在《Steps Toward Artificial Intelligence》里提出了一个看似朴素、却困扰了整个领域六十多年的问题:当一连串动作在很久之后才换来奖励(或惩罚),我们该如何判断,究竟是其中哪一步动作该记功、哪一步该担责? 他把这个难题命名为 credit assignment problem。
这个问题之所以根本,是因为它直击reinforcement learning(强化学习,简称 RL)的核心逻辑。强化学习靠「试错—拿奖励—调整策略」运转,而现实任务往往奖励极其稀疏且严重延迟:下围棋时,只有终局才告诉你输赢;让 LLM 智能体写代码、跑实验,往往要执行几十步后才出现一个可验证的结果。中间那几十步里,哪一步是功臣、哪一步是祸首,信号几乎为零。
两种信用分配
信用分配可以拆成两个维度。一是时序信用分配:奖励延迟了 N 步才到来,应该回溯分摊到前面哪些时间步?二是结构信用分配:系统由多个组件(子策略、工具、记忆模块)协作完成目标,功劳该归哪个组件?长周期 AI 智能体恰恰同时踩中这两个坑——交互分支爆炸、奖励稀疏、组件众多。
图1:信用分配的两副面孔——时序(哪一步)与结构(哪个组件)
为什么长周期智能体特别难
今天的 LLM 智能体把这个问题放大了。单轮对话式微调里,RL 表现亮眼;可一旦进入长周期、多分支的「智能体推理」,每多一个决策点,可能轨迹数就翻几倍,而真正能验证成败的信号仍只在终点出现一次。重梯度反向传播的训练栈既昂贵又难以扩展,信用分配更是雪上加霜。
正因为此,近期两条新路线不约而同地绕开了传统 RL 的瓶颈:一条是用evolution strategies(进化策略,简称 ES)做全参数微调——只靠「扰动参数、跑一遍、按奖励加权更新」,无需反向传播,显存只要推理级别;另一条是把长任务拆成子任务,让每个子任务在短时程内独立完成并被验证,长轨迹由「已验证的子解法」拼装而成,探索成本从指数 T^K 降到线性 T×K。两者本质都是在用不同方式「重新定义信用该往哪摊」。
图2:长周期轨迹分支指数增长,而奖励只在终点出现一次
本节你将能
- 说出信用分配问题的两种形态(时序 / 结构)及其差异;
- 解释为什么长周期 LLM 智能体让传统 RL 的信用分配更难;
- 理解 ES 微调与子任务分解为何能缓解这一瓶颈。