论文

AnyGoal:视觉语言引导的多智能体探索 无需训练 终身导航

AnyGoal: Vision-Language Guided Multi-Agent Exploration for Training-Free Lifelong Navigation

智能体系统Agent 协作

摘要

当转移到分布外的场景、类别或目标模式时,在大型模拟语料库上训练的端到端导航策略会急剧退化。 Modular GOAT 等模块化管道受到闭集对象检测召回的瓶颈,而 3D 快照内存系统(例如 3D-Mem)会积累密集的、依赖于视图的表示,而这些表示的维护工作量很大。我们推出了 AnyGoal,这是一种 无需训练 多机器人架构,它将视觉语言模型 (VLM) 置于基于前沿的探索的核心,并通过共享的 2D 高斯贝叶斯值图 (BVM) 协调代理。 BVM 在目标相关性上保持每像素(mu,sigma^2)后验,通过深度锥掩模对 VLM 分数进行精确加权融合进行更新,并且永远不会在子任务之间重置,从而产生终生证据积累。边界通过 VLM 作为判断的 softmax 和 BVM 上的贝叶斯 UCB 项的凸混合进行排名。具有空间分离惩罚和承诺滞后的贪婪分配器在没有集中控制器的情况下跨代理分配边界。在完整的 GOAT-Bench val 未见分割(360 个情节,2,669 个子任务)上,我们的双智能体系统在 12.7% SPL 下实现了 52.4% 子任务 SR——在严格的物理机制(离散 0.25 m 步长,无隐形传态,42 度 HFOV)下的最先进水平,并且比模块化 GOAT 提高了 +27.5 pp (24.9%)。单代理 AnyGoal 实现了 41.9% 的子任务 SR,显示了决策架构带来的收益。四向感知消融表明开放词汇检测器将主要失败模式从探索转变为目标验证。