论文

MementoGUI:长视野的学习代理多模式记忆控制 GUI智能体

MementoGUI: Learning Agentic Multimodal Memory Control for Long-Horizon GUI Agents

上下文与知识记忆Agent记忆

摘要

最近的 GUI智能体 在视觉基础和动作预测方面取得了实质性进展,但它们在需要跨许多界面转换维持任务状态的长期任务中仍然很脆弱。现有的代理通常依赖于原始历史重播或纯文本记忆,这要么用冗余的屏幕截图淹没模型,要么丢弃未来决策所需的局部视觉证据。为了解决这些限制,我们引入了 \textbf{MementoGUI},这是一个插件智能体记忆框架,它为基于 MLLM 的 GUI智能体 配备了 \textbf{MementoCore},这是一个用于在线记忆选择、压缩和检索的学习控制器。 MementoGUI 没有将交互历史视为固定上下文,而是将长视野 GUI 控制制定为在线记忆控制问题:工作记忆通过文本摘要和 ROI 级视觉证据选择性地保留与任务相关的界面事件,而情景记忆则通过学习的相关性选择来检索可重用的过去轨迹。 MementoCore 将记忆控制模块化为专门的运算符,用于步骤处理、内存压缩、情景写入和情景选择,从而无需微调 GUI智能体 主干即可实现插入式内存增强。我们进一步开发了一个可扩展的数据管理管道,将计算机使用轨迹转换为记忆控制器训练数据,引入 \textbf{MementoGUI-Bench} 来评估 GUI智能体 中的长期决策,并为语义动作匹配、任务进度和内存一致性设计基于 MLLM 的指标。 GUI-Odyssey、MM-Mind2Web 和 MementoGUI-Bench 上的实验表明,MementoGUI 相对于无历史、历史重放和纯文本内存基线持续改进了 GUI智能体,更大的 MementoCore 主干进一步增强了内存增强 GUI 控制。