论文
EmboCoach-Bench:开发实体机器人的人工智能代理基准测试
EmboCoach-Bench: Benchmarking AI Agents on Developing Embodied Robots
摘要
具身AI领域正经历向通用机器人系统的快速演进,其推动力是高保真仿真与大规模数据收集。然而,这种扩展能力仍然严重受制于劳动密集型的人工监督,从复杂的奖励塑形到跨异构后端的超参数调优。受LLM在软件自动化与科学发现中成功的启发,我们提出EmboCoach-Bench,一个评估LLM智能体自主工程化具身策略能力的基准。该基准涵盖32个专家精选的RL与IL任务,以可执行代码作为通用接口。我们超越静态生成,评估一个动态闭环工作流:智能体利用环境反馈迭代地起草、调试和优化方案,涵盖从物理先验的奖励设计到扩散策略等策略架构的改进。大量评估带来三点关键发现:(1)自主智能体在平均成功率上可定性超过人工工程基线26.5%;(2)带环境反馈的agentic工作流有效强化策略开发,并显著缩小开源与专有模型之间的性能差距;(3)智能体对病态工程案例展现自我纠错能力,通过迭代仿真在环调试将接近全失败的任务性能成功挽救。最终,这项工作为自演化具身智能奠定基础,加速具身AI领域从劳动密集型人工调优向可扩展自主工程的范式转变。
