论文

代理驱动的自主强化学习研究:四足运动的迭代策略改进

Agent-Driven Autonomous Reinforcement Learning Research: Iterative Policy Improvement for Quadruped Locomotion

应用与实践科学研究

摘要

本文记录了代理驱动的四足动物自主强化学习研究的案例研究。该设置并不是一个完全自动启动的研究系统。人类通过代理编码环境提供高级指令,而代理则执行大部分执行循环:读取代码、诊断故障、编辑奖励和地形配置、启动和监控作业、分析中间指标以及提出下一波实验。在 Isaac 实验室的 DHAV1 12-DoF 四足动物上进行了 70 多次实验,分为 14 波,该代理从平均奖励约为 7 的早期崎岖地形运行进展到了最佳记录的第 12 波运行,exp063,速度误差为 0.263,超时为 97%,超过 2000 次迭代,在不同的 GPU 上独立再现了五次。该档案还记录了几个具体的自主研究决策:将 PhysX 死锁隔离到包含盒子和楼梯状基元的地形集,从公开可用的参考实现中移植四个奖励项 \cite{deeprobotics, rlsar},纠正 Isaac Sim 导入和引导问题,减少诊断的环境计数,终止挂起运行,以及在重复地形 = 0.0 结果后将工作量从 HIM 上转移出去。相对于 AutoResearch 范式 \cite{autoresearch},本案例研究在更容易失败的机器人 RL 设置中运行,具有多 GPU 实验管理和模拟器特定的工程约束。该贡献是实证性的和记录性的:它表明智能体可以在有限的人为干预的情况下在该领域实质性地执行迭代强化学习研究循环,同时还明确人类的方向仍然影响着议程。