论文

从交互轨迹到持久技能:计算机使用智能体的在线演化

From Interaction Traces to Persistent Skills: Online Evolution for Computer-Use Agents

上下文与知识智能体系统记忆Agent SkillsAgent记忆

摘要

计算机使用的智能体可以在图形界面中执行日益复杂的任务,但它们的交互体验通常是短暂的:从一次部署中获得的程序知识不会在以后的任务中系统地保留、完善和重用。现有的技能库提供了外部程序知识,但它们相对于没有技能的同一智能体操作的增量价值,以及它们在重复交互下的纵向动态,仍然没有得到充分的表征。我们提出了一个在线技能进化框架,它将交互轨迹和评估者反馈转换为持久的、版本化的可重用程序库。每次迭代都会针对冻结的库快照执行,并且在后续迭代中可以使用证据引导的技能更新,而无需更改模型参数。我们在相同的固定动作生成和 GUI 基础堆栈、任务集和迭代范围下,将完整的演化库系统与跨四个 OSWorld 应用程序域的配置匹配的空库控制进行了比较。经过五次迭代的空文库预热后,Full 在所有四个观察到的域运行中获得了更高的预热后平均评估分数,平均差异范围为 5.7 到 18.6 个百分点,并且具有域相关的时间稳定性。在 GIMP 中,来源感知分析揭示了跨原始任务边界的检索和修订改动,其中重复接受的编辑无法恢复原始任务。这些发现将不断发展的技能库描述为可审计的、共享的程序记忆,可以改进固定的计算机使用堆栈,同时表明它们的好处是有条件的,重复修改并不能保证恢复。代码在此 https URL 发布。

从交互轨迹到持久技能:计算机使用智能体的在线演化:论文配图
图 1:在线技能演变。 StS_{t} 下的执行会产生经过抽象和诊断的轨迹,以创建、编辑、删除或保留技能。已接受来自 St+1S_{t+1} 的更改。执行器只能看到一个轻量级目录,除非它显式检索完整的技能主体。