论文
为怀疑设计:自主智能体中知情弃权的案例
Designing for Doubt: The Case for Informed Abstention in Autonomous Agents
摘要
随着大型语言模型获得工具访问权限并部署为能够编辑记录、执行事务和修改基础设施的自主代理,我们仍然根据任务完成的唯一指标来评估它们。我们认为这种评估重点构成了系统设计的失败。基准评分、产品指标和默认部署配置都会奖励代理继续进行,即使他们缺乏安全执行所需的输入、证据或授权。我们将这种现象称为合规偏差。本文做出了三点贡献。首先,我们展示了合规性偏差如何嵌入到当前塑造代理开发的评估制度中:突出的基准要么惩罚暂停的代理,要么无法衡量暂停是否适当。其次,我们介绍了知情弃权框架,它将弃权重新概念化为一种结构化能力,而不是一种失败模式:一种先决条件感知的暂停,它会阻止下一个工具调用,命名缺少的内容,并路由到具体的恢复操作。第三,我们指定了部署中知情弃权的要求,认为运行时强制、校准的保护机制和可审计的跟踪生成应该成为代理系统设计的标准属性,而不是可选的添加。我们对 144 个场景和 7 个模型系列的方法进行了初步评估。我们的结果表明,运行时执行在授权场景下实现了 87.5-91% 的危险操作阻止率和 75-92% 的可用性,合规偏差在模型系列中采取两种结构上相反的形式,并且安全性与可用性的权衡是可调的而不是固定的。