论文
ROMA:面向实体交互的多感官主动感知 LLM 系统
ROMA: LLM System for Real-World Object-Centric Multi-Sensory Active Perception
摘要
人类本质上是通过一个积极的过程来理解物理世界的。当感官证据不足以推断物理特性时,我们自然会通过决定缺少哪些信息、如何获取信息以及何时获得足够的证据来与环境进行互动。与之形成鲜明对比的是,现有的多感官机器人系统主要集成感官输入,而不是通过交互主动获取缺失的证据。在这项工作中,我们介绍了 ROMA,一个基于 LLM 的系统,用于现实世界中以对象为中心的多感官主动感知。 ROMA 将视觉、音频、触觉和力感应集成到推理-交互-反馈循环中。该模型识别缺失的证据并确定目标对象、交互和模式,而物理界面则执行选定的交互并收集多感官反馈。为了支持这一功能,我们构建了 ROMI-2K,这是一个大规模的现实世界多感官对象交互数据集,涵盖近 2,000 个对象和 6 个具有同步感官反馈的原子交互。基于这些数据,我们开发了一个两阶段的训练框架,该框架可以调整感官模式,并使 LLM 能够评估证据充分性、选择信息交互以及对多感官反馈进行推理。我们进一步将主动感知描述为感知链,其中获得的证据指导后续的交互和推理,并建立ROMA Bench来评估单属性、长视野多属性和意图驱动的主动感知。实验表明,ROMA可以主动获取缺失的证据,解决现有方法难以处理的复杂、长链的多感官感知任务,为智能体的主动多感官体现奠定了坚实的感知基础。
