论文

用于改进人机对象交接预测的 RGB-D 视频生成

RGB-D Video Generation for Improving Human-to-Robot Object Handover Prediction

模型训练合成数据

摘要

人机(H2R)对象切换是人机协作的一项基本功能,但由于大规模、以人为中心的数据集的稀缺以及模拟与真实之间的巨大差距,阻碍了进展。为了应对这些挑战,我们引入了 Hand2Bot,这是一个 RGB-D 视频数据集,它提供丰富的上下文信息,例如身体姿势和面部表情,专门针对具有真实世界噪声模式的切换场景收集。我们进一步提出了 PassGen,这是一种生成管道,利用稳定的视频扩散和意图感知的时间面部编码器来合成真实的切换序列,同时确保手部对象的一致性。为了弥补模拟与真实之间的差距,我们实施了一种基于形态的深度编辑策略,该策略复制了物理深度图中发现的真实传感器噪声。实验评估表明,我们的框架在消融研究和物理机器人平台上的实际部署中均实现了较高的意图识别准确性和较低的错误触发率。我们的结果证实,与传统的以手为中心的基线相比,PassGen 上的训练可以实现强大的零样本传输和更早的意图预期,从而有效地在共享工作空间中实现具有社交意识的机器人行为。