论文

LiveVLN:打破视觉语言导航中走走停停的循环

LiveVLN: Breaking the Stop-and-Go Loop in Vision-Language Navigation

摘要

最近的导航系统取得了强劲的基准测试结果,但现实世界的部署通常仍然明显走走停停。出现这个瓶颈的原因是感知-推理-执行循环仍然阻塞:在每次新的观察之后,控制器必须等待感知、传输和推理,然后运动才能继续。因此,仅降低行动生成成本并不能消除多余的等待。为了解决这个问题,我们提出了 LiveVLN,这是一个 无需训练 框架,通过使用多步动作延续来增强预训练的 VLM 导航器,以实现更连续的具体导航。 LiveVLN 不会在每个完整的感知和推理回合中暂停,而是将执行与新到达的观察结果的处理重叠,从而允许在当前可执行前缀耗尽之前传递刷新的未来操作。这种设计使动作在运动过程中持续可用,减少空闲等待并实现更顺畅的在线执行。该框架在运行时运行,并且可以与兼容的预训练 VLM 导航器集成。在 R2R 和 RxR 中,LiveVLN 保留基准性能,同时减少等待时间并提高操作可用性。在实际部署中,它在 StreamVLN 上将平均剧集等待时间缩短了 77.7\%$,并将挂钟剧集时间缩短了 12.6\%$,在 NaVIDA 上缩短了 19.6\%$,从而在部署过程中实现了更加连贯的执行。代码可在 https://github.com/NIneeeeeem/LiveVLN 获取。