论文

Uni-LaViRA:用于统一实体导航的语言-视觉-机器人动作翻译

Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation

智能体系统Agent 架构与控制循环

摘要

具身导航需要代理将语言和视觉观察映射到一系列空间动作,驱动真正的机器人穿过它从未见过的环境。主要方法是在越来越大的机器人轨迹集合上扩展视觉-语言-动作(VLA)基础模型。本文认为,特别是对于导航而言,可以从结构上获得通用性,而不仅仅是通过数据规模。导航的底层决策结构简化为单一的语言-视觉-机器人动作翻译。语言动作发出语义级定向命令,视觉动作发出像素级视觉目标。两个输出都位于预训练多模态 大语言模型 (MLLM) 的自然输出流形内,因此任务可以由代理推理,而不是从机器人数据中学习。因此,我们提出了 Uni-LaViRA,这是一种统一的代理架构,以零射击的方式将相同的洞察力扩展到四个任务系列(VLN-CE、ObjectNav、EQA 和 Aerial-VLN)和四个异构真实机器人(轮式机器人、四足机器人、人形机器人和自制无人机)。两种代理循环机制使这种统一变得切实可行。 TODO 列表记忆 (TDM) 在每一步重写待处理子目标的结构化清单,将未完成的项目背诵回代理最近的注意力窗口中。第二次机会回溯(SCB)将机器人回滚到错误前的状态,并根据失败的子轨迹调整智能体的下一个计划,将单次导航转变为自我纠正过程。在零训练工作量的情况下,Uni-LaViRA 在 VLN-CE R2R 上达到 60.7% SR,在 VLN-CE RxR 上达到 51.3%,在 HM3D-v2 上达到 77.7%,在 HM3D-OVON 上达到 60.0%,在 MP3D-EQA 上达到 54.7%,在 OpenUAV 上达到 40.0%,匹配甚至超过了最近消耗数百万个样本和数据的训练导航基础模型。数千个 GPU 小时。