论文
GenPHRI:物理人机交互的代理生成模拟
GenPHRI: Agentic Generative Simulation for Physical Human-Robot Interaction
摘要
现实世界的物理人机交互 (pHRI) 开发成本高昂且缓慢,而模拟则需要大量特定于任务的场景和动作创作。我们提出了 GenPHRI,这是一个生成模拟框架,用于使用视觉语言模型 (VLM) 代理完全根据自然语言任务描述生成可部署的 pHRI 场景。生成的场景包含一个带家具的房间、适合任务的人体姿势和位置,以及执行所请求交互的机器人。生成器和批评者代理在每个组件上迭代,协调器代理控制跨阶段决策。借助 GenPHRI,我们在模拟中生成 50 种不同的辅助场景,无需人工干预,并在 12 名参与者的用户研究中部署两项任务。在这些场景上训练的视觉策略在现实世界试验中实现了约 80% 的零样本任务完成率,而在模拟中则达到了约 90%,同时产生了参与者认为与文本任务提示一致的行为。此外,我们演示了生成运动的直接执行作为补充,无需训练 部署路径,能够以接触覆盖为代价快速实际检查生成的轨迹。我们发布 GenPHRI 作为一个平台,用于根据文本提示生成、训练和部署 pHRI 任务。其他信息可以在我们的项目网站上找到:https://rchi-lab.github.io/gen_phri/