论文

冻结 VLA 的恢复控制:复杂纠正器能否胜过简单撤退?

Does a Learned Corrector Beat a Simple Retreat? Evidence from a Frozen VLA

智能体系统Agent任务评测

摘要

在为冻结的视觉语言动作(VLA)策略部署运行时恢复之前,需要确认干预带来的成功率改善超过普通重复运行的变化,并且复杂方法比简单动作有额外价值。我们在四个 RoboTwin 任务中评测冻结的 $π_{0.5}$。每个测试种子都配对有纠正与无纠正的运行轨迹,并加入同种子基础策略重跑作为安慰剂。按种子聚类的区间和预先指定的比较规则,评估超出随机结果变化的净收益。在3,888组配对回合中,完整流程使 beat_block_hammer 任务成功率提高 $+13.5$\,pp,95\%区间为 $[+9.4,+17.7]$,而所用权重下其余三任务没有可检测的收益。在有响应任务的基础失败回合中,普通重跑有 $43.2\%$ 成功,纠正后为 $63.5\%$;许多名义上的恢复因此反映基础策略自身的波动。固定时刻触发并用脚本退回较早关节配置也带来净收益,两轮中均未检测到与学习流程的差异,但预设等价标准没有始终满足。暂停和恒定动作对照未产生类似改善。在此基准中,是否干预强烈依赖任务;配对安慰剂和简单退回基线是确定学习式纠正贡献的必要对照。

冻结 VLA 的恢复控制:复杂纠正器能否胜过简单撤退?:论文原图
图1:被测流程和测量协议。左:部署时运行冻结策略、停滞监测器与蒸馏纠正器;特权教师和反事实准入仅用于训练种子,175个候选恢复保留87个。右,bbh:基础失败回合经干预成功63.5%,安慰剂为43.2%,差值约20.4个百分点;下方为三条件净效应的95%区间,再下为退回和纠正器的消漂移差值,其90%区间(未绘)超出正负5个百分点带(3.3节)。底:同一bbh测试种子在第149步同样报警,分别执行脚本退回和纠正器;各四帧,顺序排列但未按比例。