论文

实例锚定的交互证据:在人类指向和处理方面扎根机器人计划

Instance-anchored interaction evidence: Grounding robot plans in human pointing and handling

上下文与知识模型评测应用与实践上下文工程模型行为与机制分析机器人

摘要

协助人们的机器人通常必须根据人们所展示的而不是所说的采取行动:指向几个相同的纸箱中的哪一个,或者处理了哪个盒子。该计划是从最终场景开始执行的,而证据则更早出现,可能是在后来移动的物体上。我们提出实例锚定交互证据(IAE),它将最终场景的每个对象注册到其公共标识符,通过向后掩模传播在视频中保留每个身份,并通过手、前臂和这些实例之间的几何形状描述每一帧。仅根据任务结果训练的证据网络对实例进行评分。对于指向任务,使用结构化损失训练的语法约束动态程序可以解码目标目标程序;符号程序可以处理参考消歧,并且无需学习即可处理情景任务。在 1,255 个 WatchAct 基准请求中,通过符号执行进行评分,IAE 在隐式意图任务上的计划成功率为 64.2%,而 32B 视觉语言模型为 27.5%(严格成功率为 49.7%,对 15.4%),在隐式意图任务上计划成功率为 46.4%,而在 32B 视觉语言模型上则为 27.0%。 无需特定任务培训即可恢复、逆转和模仿。具有相同感知覆盖、相同 32 帧、前向跟踪或在相同标签上训练的关系模型的控制不能解释增益。考虑到 IAE 的证据是文本形式并解释了其含义,相同的语言模型达到了 57.4%:大部分收益来自于实例锚定的证据,显式程序以一小部分成本增加了 6.8 分。指向仍然是最难的情况,严格成功率为 16.9%。该代码可在https://github.com/WeiZhou96/iae-watchact. 获取