论文
Embodied-BenchClaw:面向具身空间智能基准构建的自主多智能体系统
Embodied-BenchClaw: An Autonomous Multi-Agent System for Embodied Spatial Intelligence Benchmark Construction
摘要
基准对于评估体现的空间智能至关重要,但其构建是劳动密集型的,难以重用且难以维护。现有的具体基准通常是静态的,并且随着模型的改进可能很快就会饱和,从而限制了它们区分新功能的能力。我们提出了 Embodied-BenchClaw,这是一种用于构建体现空间智能基准的自主代理系统。给定用户指定的评估意图,Embodied-BenchClaw 会通过五个阶段的管道自动生成完整且可持续更新的基准测试包:意图蓝图、数据收集、结构化和清理、基准综合和评估报告。该管道由三个代理协调进行规划、建设和评估。为了提高可重用性和可靠性,Embodied-BenchClaw 引入了可扩展的技能库和过程质量控制,使基准构建可组合、可验证和可修复。我们实例化了多个基准,涵盖室内空间推理、室外空间推理、机器人操纵、四足机器人导航、无人机/鸟瞰理解和静态基准增强。这些基准涵盖不同的具体载体、数据源和空间能力。人类评估、基于判断的评估、一致性检查、成本分析和消融实验表明,Embodied-BenchClaw 可以构建可验证、可执行、可维护和诊断有用的体现空间基准,同时减少人工工作量。
