论文

VerNav:验证者优先的低延迟视觉和语言导航

VerNav: Verifier-First Low-Latency Vision-and-Language Navigation

智能体系统Agent 架构与控制循环

摘要

视觉和语言导航 (VLN) 需要代理根据自然语言指令在看不见的 3D 环境中导航。显式推理可以提高指令理解和语义基础,但每一步的自回归生成都会在多步导航上积累大量决策阶段延迟。我们提出了 VerNav,一种用于基于 LLM 的低延迟 VLN 的验证者优先框架。验证器通过用批量动作验证替换每步自回归生成来减少决策阶段延迟,而仅针对不确定的决策调用基于熵的自适应生成器以生成紧凑的状态证据。为了进一步提高验证器的导航性能,我们引入了两阶段对齐方案:(i)VPO改进了静态验证器训练中的局部动作偏好对齐,(ii)步骤级强化微调在动态任务执行期间为多步骤导航采样轨迹提供了密集的进度奖励。 Room-to-Room (R2R) 基准测试表明,VerNav 的仅验证者决策路径在基于 LLM 的代表性 VLN 代理中实现了具有竞争力的导航性能,同时与自回归方法相比,每步平均决策阶段 LLM 延迟减少了 10 倍以上。