论文

辅助护理中接触丰富的人机交互的物理一致基准

A Physics-Consistent Benchmark for Contact-Rich Human-Robot Interaction in Assistive Care

智能体系统Agent任务评测

摘要

传统的任务级评估询问机器人策略是否完成指定的动作,但可能会错过仅在人类身体接触期间出现的故障。这种限制在接触丰富的辅助任务中至关重要,其中有意义的评估需要身体反应灵敏的人类、超越任务成功的交互质量评估以及无泄漏的观察者评分协议。我们为接触丰富的人机交互引入了物理一致的基准,并在机器人辅助沐浴中实例化。该基准测试结合了可变形、被动响应的人类物理感知分数以及任务级成功,以及冻结的仅视觉/仅评分器评估协议。为了建立物理有效性,根据医疗护理人体模型上的弗兰卡阻抗推动的力压痕测量值来校准区域模拟响应。在每种方法运行 140 次的冻结 T1-T7 协议下,LLM 增强状态机 (State Machine) 实现了 72.9% 的任务成功率,但在正确区域和强制安全筛选后下降至 56.4%; VoxPoser 产生更轻、更稳定的接触,但仅完成 27.9% 的试验;零样本 pi0.5 实现了 0.7% 的任务成功率,没有正确区域或安全门控的成功。这些结果表明,任务完成本身并不意味着物理上有效的接触,并在部署接触丰富的辅助机器人策略之前激发物理感知筛选。