论文

Embodied-BenchForge:一种闭环智能体工作流用于具身基准构建

Embodied-BenchForge: A Closed-Loop Agentic Workflow for Embodied Benchmark Construction

智能体系统Agent HarnessAgent任务评测Agent Skills

摘要

智能体系统为自动化具身基准构建提供了有前景的途径,但现有方法通常仅覆盖孤立阶段,或局限于预定义环境和任务家族。更重要的是,多步构建会产生相互依赖的中间产物,这些产物常在下游传递而缺乏特定产物的验证,导致局部缺陷传播至最终基准。我们提出了Embodied-BenchForge,一种智能体框架,将用户指定的评估意图转化为完整的具身基准产物。该框架将构建过程形式化为闭环基准合成,融合前向产物合成与后向验证和修复。技能编排产物合成将类型化且可复用的技能组合成可执行的工作流,而产物依赖图记录中间输出及其依赖关系。需求引导的验证与修复在构建过程中应用产物特定的合约,并利用溯源信息在验证失败时触发局部重执行或上游回滚。Embodied-BenchForge构建了六个覆盖多样具身场景的基准,用于Offline EQA Track,以及一个包含220个可执行任务的交互式基准,用于Interactive Embodied Track。对代表性MLLMs和具身智能体的评估表明,这些基准能够区分模型在基于观察的理解和闭环执行中的能力。质量评估和消融实验验证了基准质量及验证修复的有效性,修复与技能复用分析进一步展示了局部高效恢复和跨基准复用能力。

Embodied-BenchForge:一种闭环智能体工作流用于具身基准构建:论文配图
图 1:Embodied-BenchForge 概述,作为体现基准构建的闭环代理工作流程。技能编排的工件综合选择并组合分层技能,将评估意图和具体资源转化为结构化的基准工件。需求引导的验证和修复应用需求合同和质量关卡,通过来源跟踪故障,并触发本地修复、选择性重新执行或回滚。已验证的工件将进入评估报告并被编译到离线 EQA 和交互式体现轨道中,而失败的工件将返回到受影响的构建路径。