论文

行为技能:评估长期任务中视觉-语言-行动策略的细粒度基准

Behavior-Skill: A Fine-Grained Benchmark for Evaluating Vision-Language-Action Policies in Long-Horizon Tasks

模型评测基准与评测资源

摘要

可靠地执行远距离移动操作任务仍然具有挑战性,因为整体任务的成功取决于多种组成技能的成功完成。然而,现有的基准测试仍然主要依赖于完整任务部署和聚合任务级指标,使得中间故障难以观察和分析。我们提出了行为技能,这是一个基准,围绕可执行的构成技能重新制定长期任务的学习和评估。它包含来自 10,000 个演示的 235,492 个技能实例,涵盖 50 项家务任务和 34 个语义技能类别。每个实例将技能指令与对齐的观察动作片段配对,并进一步与可恢复的中间状态和技能成功条件相关联,以实现在有效前提条件下的独立评估。我们进一步引入轨迹级别和技能级别指标来表征总体任务成功之外的政策能力。对代表性 VLA 策略(包括 pi0.5 和 GR00T)在完整的 50 项任务基准上进行的广泛实验表明,各种技能的失败高度不均匀,接触丰富的操作技能形成了持续的瓶颈。这些结果表明,行为技能通过公开中间能力概况来补充全任务评估,以分析和改进长期 VLA 策略。行为技能可在 https://github.com/nubot-nudt/Behavior-Skill 上公开获取。