论文

规模和选择:什么使自动Harness进化适用于可视化界面机器人Agent

Scale and Selection: What Makes Automatic Harness Evolution Work for Visual-Interface Robot Agents

智能体系统Agent Harness

摘要

当直接使用现成的编码Agent作为机器人策略时,通过屏幕截图观察基于浏览器的 3D 界面,并通过一些工具摆出虚拟目标夹具来执行操作,Agent的工具、其提示、工具和控制规则在很大程度上决定了成功,到目前为止,它都是手工编写的。我们证明了该工具可以通过另一个编码Agent(优化器Agent)自动改进,并报告了有关其工作原理的两个发现。首先,优化器Agent每轮看到的部署数量决定了进化后的工具是否值得信赖、通用化和稳定改进。单次rollout是一个嘈杂的二元结果,因此每轮rollout次数很少,修订版可以凭运气升级;扩大批次会提高每个促销决策的信噪比。固定轮数并将训练集从 5 次部署增加到 100 次,保留成功率从 47% 上升到 67%,而小型训练集过度拟合,训练任务达到 70%,但保留成功率只有 54%。其次,不能让优化器Agent自由发挥。当它提出的每一个修订被无条件接受时,随着错误判断的编辑的积累,性能会在十轮内下降;添加最基本的保障措施,即冠军挑战者选择,只有在同一固定评估集上严格击败现任者时才会促进修订,将相同的循环转变为在 30 轮中将坚持成功率从 51% 提高到 67% 的循环。因此,视觉界面机器人Agent的自动Harness进化是可行的,但其收益取决于每个决策背后的rollout规模以及如何选择优化器Agent的修订。