论文

CureWM:诊断与修复机器人世界模型对失败不敏感的问题

World Models Dream of Success: Diagnosing and Repairing Failure Insensitivity in Robot World Models

模型训练模型评测应用与实践监督微调与指令调优鲁棒性、公平性与可信度评测机器人

摘要

机器人世界模型支持策略评估、规划和合成数据生成,但这些应用程序需要区分成功行动和失败行动的预测。在两个架构系列的四个已发布检查点中,我们观察到对操作更改的敏感性较弱,以及对已验证失败的类似成功的预测。尽管最近的工作将故障纳入模型训练中,但哪些数据可以在不改变其架构或训练目标的情况下修复已发布的检查点,但仍有待探索。为此,我们引入了 CureWM,它根据严重性网格中的成功演示构建替代操作,通过在模拟或硬件上执行来验证其结果,并根据所产生的失败和幸存的成功以及名义演示来微调已发布的模型。这种结构提供了与共享起始上下文的受控动作对比。在 484 个保留的 LIBERO 失败反事实中,四个独立微调的 CureWM 模型的乐观度从官方数据微调后的 80% 下降到 30--43%(平均值为 38%)。在对物理机器人手臂进行的两次单独评估中,通过潜距离诊断进行的故障预测评分从单独对成功演示进行微调后的 90% 降至使用 CureWM 的 33%。在每个任务的失败计数、成功重放数据和训练预算相匹配的情况下,反事实失败产生的成功-失败值差距为 0.124,而新收集的策略内失败的成功-失败值差距为 0.014。这些发现支持事后修复的经过执行验证的反事实重放,并说明了为什么乐观情绪的降低必须与成功-失败歧视一起进行评估。代码可在 https://github.com/jiuyixu25/CureWM。 获取

CureWM:诊断与修复机器人世界模型对失败不敏感的问题:论文原图
图 2:CureWM 概述。我们以不同的严重程度干扰成功的演示,通过执行验证结果,并将成功和失败的回放与原始训练数据一起用于后期训练。严重性值、结果分配和预测值条用于说明而不是测量结果。