论文
GUI智能体 真正需要什么内存?从被动记录到主动任务驱动状态
What Memory Do GUI Agents Really Need? From Passive Records to Active Task-Driving States
摘要
移动 GUI智能体 越来越多地面临长期任务,需要跨页面和应用程序读取、更新和重用与任务相关的数据。现有的方法主要将记忆视为被动存储,累积过去的观察结果并在需要时检索。然而,检索值并不能揭示其当前在工作流程中的角色。代理仍然必须从累积的记录中推断该值是否应该立即使用、已经使用,或者必须等待稍后的依赖关系。这种隐式重建在具有重复值、干扰因素和过时状态的长轨迹中变得不可靠,导致重复或错过操作。为了解决这个问题,我们提出了主动任务驱动内存(ATMem),它将 GUI智能体 内存从被动存储转变为主动维护的执行状态。 ATMem 将任务相关信息维护为持续更新的执行状态,将每个值与其角色和当前状态链接起来,从而能够根据当前工作流程状态选择操作。虽然受监督的 微调 使智能体能够构建 ATMem,但它并没有教导 ATMem 何时有益。因此,我们引入了 STR-GRPO,这是一种在线强化学习方法,鼓励根据 ATMem 对任务完成的贡献来选择性使用 ATMem。 STR-GRPO 对比启用与禁用记忆的执行轨迹,以估计内存使用何时可以提高执行效率,而内存成本感知奖励则可以阻止昂贵的内存使用,而这不会提高执行效率。为了评估代理是否可以完成所有范围内的工作,同时避免范围外的操作,我们构建了一个具有挑战性的移动基准。从几乎相同的条目列表中,代理必须对满足指令的每个条目采取行动,并拒绝违反其约束的条目。我们进一步引入App-Level Progress和Scope-Aware F1来分别衡量这两个维度。