论文

PACE:长期具体操纵的阶段进展意识信用

PACE: Phase-Progress-Aware Credit for Long-Horizon Embodied Manipulation

模型训练奖励建模与过程监督

摘要

视觉-语言-动作 (VLA) 模型的 后训练 通常依赖于专家演示和政策交互轨迹。然而,在长视野操纵中,单个情节通常跨越数百个控制步骤和多个阶段,而成功或失败仅在情节终止时才会显现。因此,政策改进需要阶梯级信用信号来区分推动任务的行为与停滞或倒退的行为。我们提出了 PACE,这是 后训练 的一个关于长期操纵的信用分配框架,以阶段进度感知批评家为中心。 PACE由两个关键模块组成:(1)全局-局部合作价值校正批评家(GLC-Critic)聚合局部时间窗口内的视觉和运动差异特征,以推断每个步骤的阶段和阶段内进度,并将残差校正相应地应用于离散的剩余成本分布,从而实现步骤级信用分配; (2)渐进策略蒸馏(PPD)通过任务阈值将信用转换为正负条件,并训练信用条件动作生成策略:它首先用高信用正样本保护预训练的策略,然后合并所有正负信用来学习质量边界,并在推理时通过条件输出之间的差异放大高信用行为。广泛的模拟实验和各种现实世界的机械臂实验表明,PACE 始终比最强基线取得显着改进。