论文
途径:评估 AI Web 代理中的调查和上下文发现
PATHWAYS: Evaluating Investigation and Context Discovery in AI Web Agents
摘要
我们引入了 PATHWAYS,这是一个包含 250 个多步骤决策任务的基准,用于测试基于 Web 的代理是否能够发现并正确使用隐藏的上下文信息。在封闭式和开放式模型中,代理通常会导航到相关页面,但仅在一小部分情况下检索决定性的隐藏证据。当任务需要推翻误导性的表面信号时,性能会急剧下降到接近偶然的精度。特工经常声称依赖他们从未接触过的证据,从而产生调查推理的幻觉。即使发现了正确的上下文,代理通常也无法将其整合到最终决策中。提供更明确的指令可以改善上下文发现,但通常会降低整体准确性,揭示程序合规性和有效判断之间的权衡。总之,这些结果表明,当前的网络代理架构缺乏用于自适应调查、证据集成和判断推翻的可靠机制。
