论文

Rule-VLN:通过语义推理与几何矫正弥合感知与合规

Rule-VLN: Bridging Perception and Compliance via Semantic Reasoning and Geometric Rectification

智能体系统Agent任务评测

摘要

随着具身AI走向真实世界部署,视觉语言导航(VLN)任务的成功标准正从单纯可达性演变为社会合规性。然而,当前智能体深受“目标驱动陷阱”之苦,优先考虑物理几何(“我能不能走?”)而非语义规则(“我可不可以走?”),经常忽视细微的监管约束。为弥合这一差距,我们建立Rule-VLN,首个面向规则合规导航的大规模城市基准。该基准覆盖2.9万节点的庞大环境,将177类多样化监管类别注入8千个受限节点并划分为四个课程级别,以细粒度的视觉与行为约束挑战智能体。我们进一步提出语义导航矫正模块(SNRM),一个通用的零样本模块,旨在为预训练智能体赋予安全意识。SNRM将由粗到细的视觉感知VLM框架与认知心智图相结合,实现动态绕行规划。实验表明,尽管Rule-VLN对最先进模型构成挑战,SNRM显著恢复了导航能力,将CVR降低19.26%,将TC提升5.97%。

Rule-VLN:通过语义推理与几何矫正弥合感知与合规:论文配图
图 1:规则-VLN 范式。左:通过 MPSI 管道通过将语义约束注入城市拓扑来构建基准。右:与违反“禁止进入”标志的标准代理(底部)不同,我们的方法(顶部)帮助代理检测禁令,修剪非法行为,并执行合规的弯路(绿色路径)。