论文
MANGO:视觉-语言-动作模型的自动多代理测试预言机生成
MANGO: Automated Multi-Agent Test Oracle Generation for Vision-Language-Action Models
摘要
视觉-语言-动作 (VLA) 模型是新兴的机器人控制系统,它将感知、语言理解和动作生成集成在一个统一的架构中。支持 VLA 的机器人的现有测试方法依赖于手动构建的符号测试预言机,这些测试预言机根据最终环境状态确定任务是否成功。这些预言机的构建成本高昂,需要领域专业知识,并且通常与特定任务和环境紧密耦合,限制了可扩展性和重用。此外,它们仅提供任务结果的最终状态评估,对中间行为和故障定位的洞察力有限。为了解决这些限制,我们引入了 MANGO,这是一个多代理框架,可以根据机器人任务的自然语言描述自动生成细粒度的预言。 MANGO首先生成可重用的原子任务库,然后为每个原子任务生成基于模拟器的预言机定义,最后通过将复杂指令分解为有序的原子操作序列和相应的预言机来生成可执行的细粒度预言机。该框架使用协作生成器、评估器和判断代理,通过结构化反馈迭代地完善生成的工件。我们在 LIBERO_10 和 RoboCasa Humanoid Tabletop 基准测试上评估 MANGO。结果表明,MANGO 生成可执行的细粒度预言机,可以检测与符号预言机类似数量的故障,同时准确定位故障并提供更丰富的诊断信息。通过消融研究,我们进一步分析了组件贡献和初始任务集的效果,同时保持了预言机质量。总体而言,结果表明了用于 VLA 机器人测试的测试预言机生成的可行性和有效性。