论文

MetaSpace:面向具身智能体空间认知的蜕变测试

MetaSpace: Metamorphic Testing for Spatial Cognition in Embodied Agents

模型评测评测方法与指标

摘要

具身智能体是通过物理身体与环境交互的智能实体。当前,具身智能体的评估主要依赖两种范式:(1)人工标注的视觉问答(VQA)对;(2)高层任务完成指标,如导航或操作的成功率。前者费力且受标注质量波动影响。后者可能掩盖关键缺陷,使智能体能够通过次优手段或安全违规完成任务,从而隐藏安全风险与低效。鉴于空间认知是执行具身任务的基石,迫切需要评估具身智能体在任务执行过程中是否具备稳健的空间认知。受软件工程中蜕变测试原理的启发,我们提出MetaSpace,一个旨在评估智能体空间认知的新框架。通过利用从真实执行轨迹导出的时空多模态状态,MetaSpace基于植根于逻辑规则与物理定律的预定义蜕变关系(MR)自动生成测试用例。关键的是,我们将这些蜕变关系编码为逻辑编程语言(Prolog)中的可执行规则。对这些关系的违反即表明空间认知失败。在三个具身场景中的实证评估表明,MetaSpace成功检测出最先进(SOTA)多模态大模型(MLLM)驱动智能体中的90,422个空间认知错误。我们引入空间认知(SC)分数来量化性能。结果显示,所有SOTA智能体的平均得分在0.44到0.52之间,显著低于0.96的人类基准。

MetaSpace:面向具身智能体空间认知的蜕变测试:论文配图
图6:用于评估具身空间认知的MetaSpace框架流程。