论文
CognitiveReality:让语音与指向绑定机器人场景对象
CognitiveReality: Robot-Agnostic Semantic Gaussian Mapping with an LLM Agent for Immersive Collaborative VR Teleoperation
摘要
逼真的 3D 视图告诉远程操作员机器人在哪里,但不告诉操作员场景包含什么、每个对象的观察情况,或者如何将指向和语音转化为机器人动作。 CognitiveReality 将机器人的 RGB-D 流转换为实时的、语义索引的高斯-TSDF 地图,由虚拟现实中的操作员和使用工具的语言代理共享。一个映射器二进制文件仅通过配置即可服务于任何平台:它从机器人 SLAM、关节运动学、运动捕捉或内联视觉跟踪器中获取姿势,通过阴影跟踪器和关键帧锚定的 PnP 桥接定位中断,并在 2 Hz 下维护每个对象质量的开放词汇表实例标识。通过经过验证的类型化工具和操作员确认的机器人动作,语音和控制器光线针对持久的场景对象进行接地。在受控代理评估中,部署的本地 Qwen3-VL-8B 路由器达到 81.24\% 工具精确匹配,而合并感知重放正确重定向 101 个吸收的对象标识符。在机器人数据上,CognitiveReality 超出 Gaussian-plus-SDF 基线 2-8 dB; 5-40 秒 SLAM 中断期间的位姿误差保持在 1-8 厘米以内。该代理实时部署在两台四足机器人上,执行了 30 个导航请求中的 26 个和 20 个重新观察请求中的 20 个,将对象质量提高了 2-5 dB。
