论文

P2A:通过主动视觉探测改善浏览器Agent

Probe to Act: Elevating Browser-Use Agent via Active Visual Probing

智能体系统上下文与知识记忆Agent 环境交互Agent HarnessAgent记忆

摘要

浏览器使用的Agent需要结构化 Web 元数据和视觉信息之间的无缝对齐,同时在长时间交互中保留相关上下文。现有的界面通常依赖于屏幕截图级动作预测或静态标记集覆盖,让模型在每次操作之前解决密集的 DOM 像素对齐问题。我们引入了 Probe to Act (P2A),这是一个用于浏览器Agent循环的主动探测框架,可将这种对齐移动到决策时间。 P2A 通过将按需符号 DOM 结构渲染回像素,解决了符号 DOM 假设和屏幕截图布局之间的不对称桥梁。在提交改变状态的浏览器操作之前,Agent可以发出轻量级探测,将 DOM 句柄转换为像素证据,将屏幕区域映射回 DOM 候选对象,注册仅视觉目标,并提交经过验证的注释。这些交错的过程自然会产生基于证据的记忆:只有探索的、采取行动的或明确提交的观察结果才会跨步骤保存,只保留长期背景下的决策关键证据。 P2A可以作为标准DOM+SoM接口下专有模型的提示策略,并且可以通过冷启动合成和自引导SFT提炼成开放权重模型。在三个浏览器使用基准测试中,P2A 在专有模型和微调模型的任务成功率方面都有明显的提高;例如,在 VisualWebArena 上,它将 Gemini-3-Pro 从 54.1% 提高到 61.2%,Qwen3-VL-8B 从 24.6% 提高到 32.9%,同时仅以 $\sim$1.2$\times$ 保留仅动作历史记录的峰值保留输入上下文来匹配昂贵的完整观察历史记录 ($\sim$3$\times$)。