论文

DLS:学习成功行为的失败边界以改善VLA鲁棒性

Where Success Breaks: Failure-Boundary Learning for Robust Vision-Language-Action Models

模型训练强化学习

摘要

通过监督 微调 (SFT) 改编的视觉-语言-动作 (VLA) 模型继承了结构性不对称性:专家演示告诉策略成功行为所在,但没有提供有关策略在哪里不再可靠的信号。因此,我们认为,鲁棒的 VLA 适应不应被视为进一步的演示拟合,而应被视为**失败边界学习**——*发现*、*定位*和*塑造*可恢复偏差与任务失败之间的边界问题。为了实例化这一观点,我们提出 **DLS**:基于少量真实演示和模拟协同训练的**真实行为先验**,DLS 通过 同策略 数字孪生执行轨迹大规模“发现”故障边界。 **语义进度定位**不是将每条执行轨迹减少为二进制标签,而是使用特权模拟器状态来分配进度感知信号,这些信号捕获“何处”跨越了故障边界,而不仅仅是“是否”。这些信号驱动流动动力学中的**方向边界塑造**——加强产生成功的去噪方向并抑制产生失败的方向,而无需动作似然或辅助价值评估器。在真实的机器人操作任务中,DLS 提高了 SFT 和在线 RL 基线的鲁棒性,特别是在随机初始状态和不可见的视觉条件下。