论文
系统化多智能体视觉和语言导航:公式、基准和方法
Systematic Multi-Agent Vision-and-Language Navigation: Formulation, Benchmark, and Method
摘要
视觉和语言导航(VLN)主要关注单个Agent遵循单个指令,但许多现实世界的应用程序需要机器人团队来处理超出任何单个Agent能力的任务。我们提出了系统化多智能体视觉和语言导航,据我们所知,首次将多智能体 VLN 系统化形式化为受限协调问题:每个任务由带有依赖性和资源约束(存在锁和保持链)的子任务组成。经过验证的四阶段制作流程将任务实例化为 MAVLN,包括 145 个场景的 11,724 个情节,在三种指令制度下最多由四个Agent组成的团队,并附有定制的约束感知指标。我们进一步提出 TRISS,一个协调就绪的导航系统,耦合基于 LLM 的子任务调度程序,一个将每个智能体的探索转化为团队知识的共享拓扑内存,以及一个冲突感知执行机制,将同时意图实现为无碰撞路线。大量实验将 TRISS 确立为综合基线,并揭示了调度、规划和执行方面的巨大改进空间,突出了 MAVLN 任务约束下协调的挑战。项目页面:https://xyz9911.github.io/mavln.