论文
ManiUnit:长期任务的操作技能数据集和基准
ManiUnit: A Manipulation Skill Dataset and Benchmark for Long-Horizon Tasks
摘要
长视距移动操纵需要机器人在多房间环境中导航并在单一自然语言指令下执行一系列操纵技能。学习和评估这些技能面临三个挑战:在固定任务指导下的类似观察可能会使技能选择变得模糊;即使前一个技能成功,下一个技能继承的机器人状态也可能偏离其演示的起始状态并影响执行;任务级别的指标阻碍了特定技能的诊断,而早期的失败使以后的技能无法得到测试。因此,我们引入了 ManiUnit,这是一个根据 50 个 BEHAVIOR-1K 活动构建的操作技能数据集和基准。其数据集包含 21 种技能类型和 417 个子任务的 137,899 个细分,其基准测试包含 1,260 个测试实例。相应地,ManiUnit 将每个段与显式子任务指令配对;测量机器人起始基座位置或关节配置的扰动灵敏度;并恢复中间模拟器状态并定义本地成功条件,以便 可以在不执行前面的阶段的情况下评估每项技能。对代表性视觉-语言-行动(VLA)政策的评估表明,相似的总分可以掩盖每项技能的巨大差异。测试的起始状态扰动也会降低执行能力:在完整的基准测试中,与演示的起始状态相比,联合扰动将成功率降低了约 56%。在两项长期活动中,在 ManiUnit 分段上训练的技能策略取得了 78.7% 的本地操作成功率,而在完整演示上训练的任务策略则取得了 49.3% 的成功率。训练有素的技能进一步支持这些活动的完整任务执行,因为通过规划者协调任务和技能策略将完整任务的成功率从 4.0% 提高到 18.0%。