论文

合成网络:用于诊断语言智能体认识论弱点的对抗性策划迷你互联网

The Synthetic Web: Adversarially-Curated Mini-Internets for Diagnosing Epistemic Weaknesses of Language Agents

智能体系统Agent任务评测

摘要

语言智能体日益成为通过搜索、浏览和综合多源信息工作的联网系统。然而,这些来源可能包含不可靠或对抗性内容,而智能体对对抗性排序——误导性信息在搜索结果中占据显著位置——的稳健性仍知之甚少。现有基准评估功能性导航或静态事实性,但无法因果地隔离这一脆弱性,而当前针对检索增强生成的缓解策略在此类条件下大多未经检验。我们提出Synthetic Web Benchmark,一个程序化生成的环境,包含数千篇带可信度与事实性真实标签的超链接文章、过程级交互轨迹以及消除训练数据泄漏的污染过滤。通过向可控搜索排序注入单篇高可信度错误信息文章,我们在六个前沿模型上测量对抗性暴露的因果效应。结果揭示了灾难性失败:尽管可无限制访问真实信息来源,准确率仍然崩溃,搜索升级极少且校准严重失准。这些发现暴露了当前前沿模型处理冲突信息方式的根本局限,对高风险领域的部署具有直接意义。我们的基准支持对这些失败模式的系统分析,并提供了在对抗性排序下评估缓解策略的受控试验台——这是当前研究的一个空白。这项工作为开发搜索稳健、认识论谦逊、能在高风险领域抵抗操纵的智能体确立了可复现基线。

合成网络:用于诊断语言智能体认识论弱点的对抗性策划迷你互联网
图1:Synthetic Web Benchmark 架构由四个主要组件构成:Synthetic Web(蓝色)、搜索层(Search Layer,橙色)、Agent Protocol(绿色)与评估(Evaluation,灰色)。搜索层包含用于对抗性暴露的 rank-0 蜜罐(honeypot)。每个组件在图中以颜色编码并加以描述。