论文

HARBOR:代理机器人强化学习的框架

HARBOR: A Harness Framework for Agentic Robot Reinforcement Learning

智能体系统Agent Harness

摘要

强化学习 (RL) 已成为机器人学习的强大范例,特别是在模拟到真实的环境中,但其更广泛的采用仍然受到围绕算法的工程管道的限制。构建任务、塑造奖励和调整超参数需要大量专家的努力,这使得强化学习工作流程成本高昂且难以扩展。我们介绍了 HARBOR,这是一个代理框架,它将机器人 RL 自动化构建为一个Harness工程问题:给定模拟器代码库和任务规范,它可以自动化从环境设置到模拟中的策略训练的工作流程。 HARBOR 将此类高级目标分解为由专门代理通过标准化命令、持久工件、可执行门和可重用知识执行的有界阶段,并通过分散的并行试验和跨运行的经验学习来扩展迭代。我们通过 6 个基准和总共 16 个任务来评估 HARBOR,涵盖操纵、运动和双手灵巧控制。我们证明,HARBOR 可以端到端地自动化模拟 RL 工作流程、设计奖励、调整算法以匹配或改进默认配置,并以实际词元和挂钟成本减少工程工作量;由此产生的策略也可以转移到真正的机器人上。