论文

Kintsugi-VLA:从失败仿真轨迹生成定向恢复数据

Kintsugi-VLA: Turning Failed Robot Rollouts into Recovery Data through Interventional Recoverability

模型训练合成数据

摘要

模拟通过使用特权专家生成视觉演示来实现视觉-语言-行动策略的可扩展训练,而不需要通过手动远程操作收集每个轨迹。然而,此类管道通常会保留成功的演示,而失败的轨迹会被丢弃,即使它们准确地暴露了必须从中学习恢复的非正常状态。我们引入了 Kintsugi-VLA,这是一个通过利用模拟中的精确状态恢复和分支将失败的轨迹转换为目标合成恢复数据的框架。对于固定特权专家,我们将干预可恢复性定义为模拟器恢复到给定状态后完成原始任务的概率,使用具有逐点威尔逊区间的自适应蒙特卡罗延续来估计它,并表征其沿着失败轨迹的非单调演化。这些估计确定了观察到的终端低可恢复性边界(在该点之后测量的可恢复性保持低于阈值),然后将其用于选择信息丰富的恢复起始状态。在模拟 Franka 操作任务中,在难度和帧数预算匹配下,目标恢复数据的 SmolVLA 恢复成功率分别为 34.6% 和 38.4%,比同一恢复窗口内的均匀采样高出 5.8 和 6.7 个百分点。在受干扰的端到端执行以及移动的杂波和物理条件下观察到相同的顺序,而干净任务的成功率从 76.8% 下降到 74.7%。 Kintsugi-VLA 演示了如何通过直接干预测量将失败的仿真轨迹从废弃的经验转化为结构化的恢复训练数据。

Kintsugi-VLA恢复失败仿真状态,测量可恢复性,再定向收集恢复数据训练策略。
图2(图注摘要):Kintsugi-VLA恢复失败仿真状态,测量可恢复性,再定向收集恢复数据训练策略。