论文

看与记:一个用于网页遍历的多模态智能体

See and Remember: A Multimodal Agent for Web Traversal

上下文与知识记忆Agent记忆

摘要

自主网页导航要求智能体感知复杂视觉环境并维持长期上下文,但当前基于大语言模型(LLM)的智能体常苦于空间迷失和导航死循环。本文提出普适的 V-GEMS(Visual Grounding and Explicit Memory System),一个为精确、坚韧网页遍历设计的稳健多模态智能体架构。我们的智能体集成视觉接地以消解歧义交互元素,并引入带状态跟踪的显式记忆栈。这一双重机制让智能体维持遍历路径的结构化地图,实现有效回溯并防止深度导航任务中的循环失败。我们还引入可更新的动态基准以严格评估适应性。实验显示 V-GEMS 显著压过 WebWalker 基线,取得 28.7% 的大幅性能增益。代码见 https://github.com/Vaultttttttttttt/V-GEMS。

看与记:一个用于网页遍历的多模态智能体
图1:V-GEMS框架。我们的系统在双智能体架构(Explorer与Critic)的基础上增加了一套专门的Tools套件,由Counter、URL Stack与US Calculator组成。US Calculator对页面内容进行自适应评分,以决定采用LLM还是VLM处理。URL Stack支持有状态的回溯,而Counter确保跨多次导航步骤的算术精度。端到端执行工作流的完整可视化请参见附录B。