论文
TraceFlow:通过成功和失败跟踪来指导冻结的流程匹配机器人策略
TraceFlow: Guiding Frozen Flow-Matching Robot Policies with Success and Failure Traces
摘要
具有流程匹配动作专家的视觉-语言-动作(VLA)策略通过集成学习的速度场来生成每个动作块(短命令序列);一旦其权重固定,早期执行轨迹的成功或失败就无法改变现在生成的块。并发测试时方法给出了冻结策略,例如来自检索到的成功、博学的批评者、验证者或动态模型的输入,但没有一个方法使用机器人自己的失败部署作为负面证据,除了最终结果位之外什么也没有。我们引入了 TraceFlow,这是一种与进度一致的指导字段,它将检索到的成功和失败的执行轨迹的操作密度转换为对冻结的流匹配操作专家的有界校正,每个执行轨迹使用一个终端结果位,而不使用其他标签。它的 TraceBank 存储轨迹、带有终端标签的按时间排序的状态动作记录,从目标任务训练轨迹开始,然后承认部署的机器人自己的部署。在有序的真实机器人包装任务中,基地按顺序完成了 50 次试验中的 21 次,TraceFlow 39,以及一轮没有任何权重更新的堆叠回合 47,错误序列事件从 20 下降到 0。在模拟中,增益是选择性的:通过按套件选择的设置,TraceFlow 将 RoboMemArena 序列从 78.92\% 提高到 91.50\% 任务成功率,并从第 2 轮堆叠时从 54.41\% 变为 62.00\%,保持 26 任务总数不变,将计数和遮挡降低 1.12 和 1.42 点,并将 LIBERO-Plus(长)改变 +1.27 点 (p = 0.0733)。堆叠增益是有限的,每个分支在第十轮之前达到峰值,并且银行的成功与失败比率预测没有检索分配。