论文

CIVI:公共信息搜索Agent的失败诊断

CIVI: A Framework for Diagnosing Search Agent Failures in Civic Information

智能体系统Agent任务评测

摘要

大型语言模型越来越多地部署在公共部门环境中,不正确的指导可能会造成不可逆转的损害。我们介绍 CIVI,这是第一个用于诊断公民信息搜索智能体故障的框架。其基准实例化共同跨越了跨国、跨司法管辖区的政府环境(联邦、州和地方)以及国际采用的联合国标准的职能类别。我们评估了十个前沿搜索智能体,发现没有一个符合人类注意力的基线。除了准确性之外,CIVI 还衡量搜索调用率、选择性非搜索准确性以及智能体引用权威政府消息来源的频率。为了执行此诊断,我们引入了 ARISE,它将智能体搜索失败分解为四种互斥模式,通过源注入消融进行隔离。 ARISE 将 72.1% 的观察到的失败归因于检索限制的原因,而不是模型参数知识中的差距。