论文
WebFovea视觉网页智能体Harness
WebFovea: When the Model Is Right but the Click Is Wrong -- Reliable Round Trips for Vision-Based Web Agents on Live Websites
摘要
我们提出WebFovea,一个在WebRetriever Challenge 2026获得第2名(终分57.0/100)的视觉网页智能体。该挑战按协议III端到端评估:从实时网站入口URL出发,智能体须操作网站自身界面并返回可验证答案。一个强多模态LLM是必要但非充分条件:模型的决策要经Harness抵达浏览器。每一步都有四件事必须做对:模型回复被解析为预期动作、动作在页面上生效、结果被准确回报、模型被展示所需信息。在真实网站上,我们观察到的许多失败发生在四个阶段之一而非模型推理中:坐标空间错配把每次点击放到预定坐标的3/4处;原生下拉框、iframe内与文本框中的动作静默失败;自生成的聊天模板token污染了4.9%的任务回合。WebFovea硬化每个阶段并以护栏约束智能体守规则、守预算。四阶段视角不依赖模型,尽管个别修复依赖。由于四次提交使用同一模型,官方隐藏集分数从31.0升至57.0反映的是Harness的变化(扣除实时网站的运行间方差)。我们描述设计、每个组件的证据(含负结果)、失败分析与路线图。