论文
阅读更多,思考更多:重新审视 Web 代理的观察减少
Read More, Think More: Revisiting Observation Reduction for Web Agents
摘要
基于 大语言模型 (LLM) 的 Web 代理依赖于对网页(通常表示为 HTML)的观察,作为识别可用操作和规划后续步骤的基础。先前的工作将 HTML 的冗长视为性能的障碍,并采用减少观察作为标准实践。我们重新审视这一趋势,并证明最佳观测表示取决于模型能力和思维 词元预算:(1)紧凑观测(可访问性树)对于能力较低的模型更有利,而详细观测(HTML)对于能力较高的模型有利;而且,思考词元的增加进一步放大了HTML的好处。 (2) 我们的错误分析表明,较高能力的模型会利用 HTML 中的布局信息来实现更好的动作基础,而较低能力的模型会在较长的输入下遭受更多的幻觉。我们还发现,合并观察历史可以提高大多数模型和设置的性能,并且基于差异的表示提供了一种有效的替代方案。基于这些发现,我们提出了实用指南:根据模型能力和思维 词元预算 自适应地选择观察表示,并使用基于差异的表示合并观察历史。