论文

并非所有经验都属于权重:自我改进 GUI Agent的组件路由

Not All Experience Belongs in the Weights: Component Routing for Self-Improving GUI Agents

模型训练上下文与知识持续学习记忆Agent记忆

摘要

自我改进的 GUI Agent通过微调或检索提示来保留它们产生的轨迹并将其返回给Agent,但比较两个目的地的研究并不同意。我们将其归因于经验单位:轨迹捆绑了具有不同属性的项目,因此关于捆绑的结论取决于其组合。为了解决这个问题,(i)我们引入组件路由,它将经验分成定位器、过程、状态事实和教训,并将每个组件发送到上下文或权重,在三个骨干系列、两个环境和三个种子中的相同项目上进行比较。一个池有两个目的地:定位器和课程在权重、程序和上下文中陈述事实方面获胜。 (ii) 我们在任何训练之前测量的两个属性(循环和状态条件)中拟合一条规则;它在 24 个单元中的 24 个单元中恢复了保留的骨干网系列的目的地,两次干预将组件移向边界,并且按规则进行的路由击败了每个整个轨迹基线,并且平均+3.5个点,每个骨干网的更好的单一目的地。 (iii)我们确定了训练和生产者-消费者差异如何改变两个目的地的价值:在将相同成分写入权重后,注释读数会减少,对于最常出现的项目而言,上下文增益会随着信息差距的增加而增加,权重增益会随着政策差距的增加而减少。代码和数据将被发布。