论文
Embodied-BenchForge:一种闭环智能体工作流用于具身基准构建
Embodied-BenchForge: A Closed-Loop Agentic Workflow for Embodied Benchmark Construction
摘要
智能体系统为自动化具身基准构建提供了有前景的途径,但现有方法通常仅覆盖孤立阶段,或局限于预定义环境和任务家族。更重要的是,多步构建会产生相互依赖的中间产物,这些产物常在下游传递而缺乏特定产物的验证,导致局部缺陷传播至最终基准。我们提出了Embodied-BenchForge,一种智能体框架,将用户指定的评估意图转化为完整的具身基准产物。该框架将构建过程形式化为闭环基准合成,融合前向产物合成与后向验证和修复。技能编排产物合成将类型化且可复用的技能组合成可执行的工作流,而产物依赖图记录中间输出及其依赖关系。需求引导的验证与修复在构建过程中应用产物特定的合约,并利用溯源信息在验证失败时触发局部重执行或上游回滚。Embodied-BenchForge构建了六个覆盖多样具身场景的基准,用于Offline EQA Track,以及一个包含220个可执行任务的交互式基准,用于Interactive Embodied Track。对代表性MLLMs和具身智能体的评估表明,这些基准能够区分模型在基于观察的理解和闭环执行中的能力。质量评估和消融实验验证了基准质量及验证修复的有效性,修复与技能复用分析进一步展示了局部高效恢复和跨基准复用能力。
