← 返回内容列表

BATON:把机器人任务探索成本从指数压到线性

分享本文
BATON:把机器人任务探索成本从指数压到线性

长周期机器人操控长期受困于「端到端探索指数爆炸」与「前驱污染后继」两大失败。USC 的 BATON 以子任务为探索单位、加过渡感知记忆,在 RoboMemArena 上零参数更新便提升任务成功率 11.6%。


① BATON:把机器人任务探索成本从指数压到线性

让机器人完成「把碗放进消毒柜再关上门」这类多步骤任务,传统做法有一个隐藏的灾难:每多一个阶段,需要试探的次数就乘一次方。假设每个子阶段要试 T 次才能收敛,K 个阶段连起来就要 T^K 次——K 稍大就天文数字,而且一旦某处失败,你根本不知道是哪个阶段出的错。

这正是长周期机器人操控的两大结构性失败之一。USC 研究团队在 2026 年 8 月发表的 BATON(arXiv 2608.16889)精准命名了它们:第一是组合爆炸,第二是过渡污染(transition contamination)——前驱子任务成功了,却以「后继没法用」的形态收尾(比如东西抓歪了、盖子没关严),可 VLA 原语只有「退出条件」没有「进入条件」。

图1:BATON 把探索单元从「整条任务」换成「子任务」,成本由指数变线性

BATON 的解法干净利落:让子任务成为探索的单位。每个子任务在短时程内独立完成并存下解法,长轨迹由「已验证的子解法」拼装,成本从 T^K 塌缩到 T×K;同时用一层过渡感知记忆修复污染——子任务内验证器(在调用 VLA 前用腕部视角确认场景就绪)、交接过渡(主动把前驱扰动过的状态恢复到后继可继承的入口)、前瞻过渡(模拟哪种结果能被下一个子任务继承)。

图2:三类过渡感知机制协同修复「过渡污染」

在 RoboMemArena(26 个任务、平均轨迹超 1000 步、68.9% 子任务依赖记忆)上,BATON 任务成功率较此前最佳提升 11.6%,累积成功率提升 14.9%,而且没有更新任何模型参数——增益纯粹来自「何时、以何种方式调用 VLA」的重新组织。这给所有做长周期智能体的人一个提醒:很多时候瓶颈不在模型容量,而在训练与调用的结构。



题释:原文标题 - Don’t Drop the Baton ,是指接力过程中别掉棒,正如多任务需要平滑过渡


关联推荐

评论 (0)

正文划词可点「问萝卜特」——自动发评论并由 AI 回复

加载评论中…

BATON:把机器人任务探索成本从指数压到线性 | 必学必会