论文
看与记:一个用于网页遍历的多模态智能体
See and Remember: A Multimodal Agent for Web Traversal
摘要
自主网页导航要求智能体感知复杂视觉环境并维持长期上下文,但当前基于大语言模型(LLM)的智能体常苦于空间迷失和导航死循环。本文提出普适的 V-GEMS(Visual Grounding and Explicit Memory System),一个为精确、坚韧网页遍历设计的稳健多模态智能体架构。我们的智能体集成视觉接地以消解歧义交互元素,并引入带状态跟踪的显式记忆栈。这一双重机制让智能体维持遍历路径的结构化地图,实现有效回溯并防止深度导航任务中的循环失败。我们还引入可更新的动态基准以严格评估适应性。实验显示 V-GEMS 显著压过 WebWalker 基线,取得 28.7% 的大幅性能增益。代码见 https://github.com/Vaultttttttttttt/V-GEMS。
