论文

EmboCoach-Bench:开发实体机器人的人工智能代理基准测试

EmboCoach-Bench: Benchmarking AI Agents on Developing Embodied Robots

智能体系统Agent任务评测

摘要

具身AI领域正经历向通用机器人系统的快速演进,其推动力是高保真仿真与大规模数据收集。然而,这种扩展能力仍然严重受制于劳动密集型的人工监督,从复杂的奖励塑形到跨异构后端的超参数调优。受LLM在软件自动化与科学发现中成功的启发,我们提出EmboCoach-Bench,一个评估LLM智能体自主工程化具身策略能力的基准。该基准涵盖32个专家精选的RL与IL任务,以可执行代码作为通用接口。我们超越静态生成,评估一个动态闭环工作流:智能体利用环境反馈迭代地起草、调试和优化方案,涵盖从物理先验的奖励设计到扩散策略等策略架构的改进。大量评估带来三点关键发现:(1)自主智能体在平均成功率上可定性超过人工工程基线26.5%;(2)带环境反馈的agentic工作流有效强化策略开发,并显著缩小开源与专有模型之间的性能差距;(3)智能体对病态工程案例展现自我纠错能力,通过迭代仿真在环调试将接近全失败的任务性能成功挽救。最终,这项工作为自演化具身智能奠定基础,加速具身AI领域从劳动密集型人工调优向可扩展自主工程的范式转变。

从数字到物理:数字智能体作为物理智能的自主教练
图3:任务形式化框架(Task Formalization Framework)。每个基准任务被建模为一个三元组 𝒯=(𝒟_prd, 𝒫_sys, 𝒞_env)。(左) 语义规范(𝒟_prd):作为指导目标的结构化 PRD,定义角色(personas)、约束(例如资源预算)和领域脚手架。(中) 操作接口(𝒫_sys):系统注入的协议,定义 FileEditor、Terminal 与 TaskTracker 的 API schema。(右) 开发基底(𝒞_env):目标环境,封装模拟器基础设施(Docker/K8s)以及智能体必须审计与优化的人工基线代码库。