论文

途径:评估 AI Web 代理中的调查和上下文发现

PATHWAYS: Evaluating Investigation and Context Discovery in AI Web Agents

智能体系统Agent任务评测

摘要

我们引入了 PATHWAYS,这是一个包含 250 个多步骤决策任务的基准,用于测试基于 Web 的代理是否能够发现并正确使用隐藏的上下文信息。在封闭式和开放式模型中,代理通常会导航到相关页面,但仅在一小部分情况下检索决定性的隐藏证据。当任务需要推翻误导性的表面信号时,性能会急剧下降到接近偶然的精度。特工经常声称依赖他们从未接触过的证据,从而产生调查推理的幻觉。即使发现了正确的上下文,代理通常也无法将其整合到最终决策中。提供更明确的指令可以改善上下文发现,但通常会降低整体准确性,揭示程序合规性和有效判断之间的权衡。总之,这些结果表明,当前的网络代理架构缺乏用于自适应调查、证据集成和判断推翻的可靠机制。

Web智能体决定前会先调查吗?
图8:Gemini性能比较:无提示 vs 有提示(Reddit基准)。跨五个任务类别对Investigation Accuracy、Reasoning Accuracy、Decision Accuracy和Funnel Success进行并排比较。提示显著提高了Investigation Accuracy,尤其是在User History Context中(+55.7个百分点),但对下游推理和决策指标的影响则好坏参半。