论文

ValueFormer:带有阶段感知标签的因果 Transformer 价值函数,用于半自主视觉语言动作策略

ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies

模型训练奖励建模与过程监督

摘要

通过行为克隆训练的视觉-语言-动作(VLA)策略会悄无声息地失败:仅从行动流来看,崩溃的执行轨迹看起来很像取得了正常进展,因为模仿不提供进步的概念。强化学习可以提供一种方法,但在这里是不切实际的,因为真实的机器人体验成本高昂,而且可变形食物难以模拟。廉价的替代方案,即最终成功/失败位,原则上是可以学习的,但太稀疏,无法判断何时执行轨迹出错。我们认为每帧标签,而不是架构,是最困难的部分:为了有用,它必须是密集的、连续的和正确的形状。我们提出了 ValueFormer,一种紧凑的与策略无关的因果 Transformer,它在冻结的 DINOv3 主干上,在一次前向传递中发出两个每帧信号:用于优势估计的平滑蒙特卡罗值 V_mc 和用于在线错误检测的尖锐二进制值,通过设计将目标拉向相反的方向。失败的事件被标记为阶段感知、成功然后衰退的回报,保留失败阶段之前的成功曲线,并且从错误间隔而不是单个失败时间来监督检测,因此策略从中恢复的错误也带有信号。在真实机器人双手三明治组装任务(1,427 集)中,评论家导出的每帧训练重量将任务完成率从 70% 提升到 85%(在 n=20 的噪声范围内),并且批处理的 bf16 编码器将实时服务成本降低了 3~5 倍,因此评论家以 2 Hz 的频率与单个 GPU 上的策略一起运行。