论文
Rule-VLN:通过语义推理与几何矫正弥合感知与合规
Rule-VLN: Bridging Perception and Compliance via Semantic Reasoning and Geometric Rectification
摘要
随着具身AI走向真实世界部署,视觉语言导航(VLN)任务的成功标准正从单纯可达性演变为社会合规性。然而,当前智能体深受“目标驱动陷阱”之苦,优先考虑物理几何(“我能不能走?”)而非语义规则(“我可不可以走?”),经常忽视细微的监管约束。为弥合这一差距,我们建立Rule-VLN,首个面向规则合规导航的大规模城市基准。该基准覆盖2.9万节点的庞大环境,将177类多样化监管类别注入8千个受限节点并划分为四个课程级别,以细粒度的视觉与行为约束挑战智能体。我们进一步提出语义导航矫正模块(SNRM),一个通用的零样本模块,旨在为预训练智能体赋予安全意识。SNRM将由粗到细的视觉感知VLM框架与认知心智图相结合,实现动态绕行规划。实验表明,尽管Rule-VLN对最先进模型构成挑战,SNRM显著恢复了导航能力,将CVR降低19.26%,将TC提升5.97%。
