论文

HCSG:以人为中心的视觉语言导航语义几何推理

HCSG: Human-Centric Semantic-Geometric Reasoning for Vision-Language Navigation

摘要

VLN 在扩展数据和模型容量方面取得了显着的进步。然而,静态环境的假设在现实世界的室内场景中是不成立的,机器人不可避免地会遇到动态的行人。现有的人类感知方法通常仅将人类视为基于隐式视觉线索的移动障碍物,缺乏解释人类意图或维持社会规范所需的明确推理。为了解决这个问题,我们提出了 HCSG,这是第一个以人为中心的 VLN 框架。该框架为动态人机环境中的安全、社交智能导航提供了坚实的基础,将范式从被动避免碰撞转变为主动人类行为理解。具体来说,HCSG 引入了一个统一的人类理解模块,该模块协同两个关键功能:(i)几何预测,预测人体姿势和轨迹以预测未来的运动动态; (ii) 语义解释,利用视觉语言模型 (VLM) 生成人类行为和意图的自然语言描述。这些语义几何表示被融合到代理的拓扑图中,以进行指令条件规划。此外,引入社交距离损失来强制遵守社交距离的交互距离。 HA-VLNCE 基准的大量实验表明,HCSG 显着优于最先进的方法,成功率提高了 14%,冲突率降低了 34%。我们的项目可以在 https://haoxuanxu1024.github.io/HCSG/ 看到。