论文
FocusMem:分解内容、读出和对潜在 GUI 内存的信任
FocusMem: Factorizing Content, Readout, and Trust in Latent GUI Memory
摘要
GUI智能体 必须记住早期任务中的有用经验和当前交互中未完成的进度。潜在记忆通过将多模态轨迹压缩为几个连续的标记来提供紧凑的解决方案。然而,现有的方法通常将每个轨迹映射到一个固定的内存块,并主要通过下一动作监督来训练它。这产生了三个实际问题:在压缩过程中可能会丢失重要的细节,相同的内存块必须服务于不同的决策阶段,并且不相关的检索轨迹仍然可能会误导代理。我们引入了 FocusMem,它将这些职责分离到一个紧凑的潜在内存接口中。角色感知的内容基础鼓励情景记忆来保留可重复使用的经验和工作记忆来保留任务进度。状态条件读出生成相同存储证据的特定于决策的视图,而轻量级信任门可以抑制与当前步骤无关的内存块。所有组件都经过训练,而 GUI 策略保持冻结状态。在五个 GUI智能体 基准测试中,FocusMem 始终优于完全匹配的仅动作固定内存基准和先前的潜在内存适应。进一步的分析表明,语义和功能监督保留了补充信息,随着周围轨迹上下文的增长,状态条件读出更加稳健,并且信任门减少了注入不相关的情景证据造成的危害。这些结果表明,有效的潜在记忆不仅取决于压缩过去的互动,还取决于保留什么、暴露什么以及允许什么。