论文

ReflectVLN:利用反思推理训练视觉语言导航代理

ReflectVLN: Training Vision-Language Navigation Agents with Reflective Reasoning

智能体系统Agent 协作

摘要

现有的视觉语言导航方法通常将 VLM 与路点解码器结合起来以生成多步行动计划,但它们通常缺乏明确的闭环机制来跟踪语义进度、诊断执行故障以及从长视野导航中的错误累积中恢复。为了解决这一差距,我们提出了 ReflectVLN,这是一种代理 VLN 框架,通过双向交互的意图和执行代理来组织决策。意图代理执行子任务分解和反射,生成可执行的子任务描述作为纠正计划。根据这些描述,执行代理将它们纳入当前观察下的短期行动,同时监控子目标进度并检测偏离轨道的行为。至关重要的是,ReflectVLN 支持闭环双向通信:执行代理发出进度和偏差信号以按需触发反射和子任务更新,意图代理返回结构化指导,重新调整后续操作以进行恢复。为了鼓励具有可解释的中间原理的时间连贯决策,我们引入了行动思想链(Action-CoT),这是一种用于行动生成的路径条件双查询训练方案。标准 VLN 基准测试表明,ReflectVLN 在数据预算有限的情况下提高了成功率和路径效率,具有有利的训练成本和推理时更少的高级意图调用,同时为分析和协作提供可解释的中间决策。代码位于:https://github.com/AIprogrammer/ReflectVLN