论文
仅靠安全行动并不能确保代理安全:使用警卫模型识别未履行的义务
Safe Actions Alone Do Not Ensure Safe Agents: Identifying Unfulfilled Obligations with Guard Models
摘要
防护模型越来越多地用于保护基于 LLM 的代理,主要是通过识别禁止代理执行的操作。然而,仅识别禁止行为不足以确保Agent安全。在本文中,我们认为代理安全还取决于识别所需但未执行的安全关键行动,我们称之为义务。我们对流行的安全评估基准进行的初步研究表明,56.92% 的 GLM-5.3 轨迹包含未履行的义务,而只有 30.00% 包含禁止行为。这一发现揭示了未履行的义务是以前被忽视的主要安全风险来源。然而,据我们所知,现有的基准还没有评估警卫模型是否可以识别这些义务。为了弥补这一差距,我们引入了 ObligationBench,这是第一个评估义务识别能力的基准,由 240 个经过专家验证的轨迹组成,涵盖问题解决、功能开发和终端运营。我们对 14 款代表性车型的评估揭示了实质性内容 局限性:最高召回率和精确匹配率分别仅为48.97%和10.00%。为了解决这些限制,我们使用 40,000 个综合训练示例开发 ObligationGuard。 ObligationGuard 实现了 57.52% 的召回率和 21.67% 的精确匹配率,在这两个指标上都超过了所有评估的模型。我们呼吁社区将义务识别纳入未来警卫模型的设计和评估中,以提高代理的安全性。