论文
语言作为传感器:根据自然语言校准 3D 场景中的空间置信度估计
Language as a Sensor: Calibrated Spatial Belief Estimation in 3D Scenes from Natural Language
摘要
部署在以人为中心的环境中的机器人通常会接收空间信息的自然语言描述(“我把背包落在桌子上”),这些信息涉及超出其感知视野的世界部分。传统的度量语义映射忽略了该信号,而现成的多模态模型在 3D 空间推理方面仍然受到限制,并且不能直接与其他传感器模态融合。为了将语言观察结果转换为校准的空间分布,我们训练了一个语言传感器模型(LSM),该模型将每个话语及其场景图上下文映射到多模态分布,并使用混合权重编码指称模糊性(例如,“哪个表”)和分量协方差编码空间不确定性(例如,目标位于“桌子上”的位置)。然后,我们介绍 VL-Map(视觉语言度量语义映射),这是一种概率框架,它将这些语言预测视为随机观察,并将它们与统一信念图中的机载感知融合。在 VLA-3D 基准以及现实世界的移动机器人上,LSM 是唯一协方差估计保持在校准范围内的语言预测器;融合到 VL-Map 中,它可以更准确地预测目标对象位置(与最强的基础模型基线相比,真实目标的概率质量增加约 70%)。