论文

HRBench:以交互为中心的人机协作基准测试

HRIBench: Benchmarking Interaction-Centric Human-Robot Collaboration

模型评测基准与评测资源

摘要

当前的视觉-语言-动作(VLA)基准主要评估孤立的操作技能,而人机交互结构很大程度上未建模。然而,现实世界的协作从根本上需要在共享代理下进行协调,包括意图理解、时间同步、协议遵守以及动态环境中的安全交互。为了解决这一差距,我们引入了 HRIBench,这是一种基于可执行交互场景的意图感知人机协作的诊断基准。 HRBench 将协作任务表示为结构化场景脚本,这些脚本显式地模拟代理角色、时间依赖性、协调约束和人类行为分布。在此抽象基础上,HRIBench定义了三种具有代表性的交互角色:指导者、协作者和入侵者,涵盖了意图沟通、联合协调和人为干预下的鲁棒性。该基准包含 13 个角色条件任务,以及从不同的交互轨迹和场景变化生成的超过 650 个评估片段。除了二进制任务成功之外,HRIBench 还引入了可解释的以交互为中心的指标,涵盖同步、响应能力、协议合规性和安全性。我们在统一协议下评估基于 GR00T、pi0.5 和 ACT 的适应策略。结果表明,尽管操纵能力很强,但当前的基础机器人策略在协作环境中仍存在很大困难,揭示了时间协调和意图感知行为的主要局限性。 HRIBench 上的 微调 持续提高协作性能。在现实世界的适应研究中,HRIBench 生成的模拟数据将 GR00T N1.5 的物理任务成功率从 0.10 提高到 0.43,证明了该基准对于推进以交互为中心的机器人学习的价值。