论文

COMPASS:评估 LLM 组织特定政策遵循性的框架

COMPASS: A Framework for Evaluating Organization-Specific Policy Alignment in LLMs

模型评测安全与风险评测

摘要

随着大型语言模型被部署到从医疗到金融的高风险企业应用中,确保其遵循组织特定政策已变得至关重要。然而,现有安全评测仅关注普遍性危害。我们提出 COMPASS(Company/Organization Policy Alignment Assessment),首个评估 LLM 是否遵守组织允许清单与禁止清单政策的系统框架。我们将 COMPASS 应用于八个多样的行业场景,生成并验证 5,920 条查询,通过策略性设计的边界案例测试常规合规与对抗鲁棒性。在评测七个最先进模型后,我们发现一个根本性的不对称:模型能可靠处理合法请求(准确率超过 95%),但在执行禁止事项上灾难性失败,对对抗性禁止清单违规仅拒绝 13%—40%。这些结果表明,当前 LLM 缺乏政策关键部署所需的鲁棒性,COMPASS 由此成为组织 AI 安全的一项重要评测框架。

COMPASS:评估 LLM 组织特定政策遵循性的框架 配图
图 2:Compass 框架概览。给定组织的允许清单(allowlist)与拒绝清单(denylist)策略,Compass 生成直接反映策略意图的基础查询,以及探测策略边界的边缘查询(例如通过对抗性变换)。组织的聊天机器人对这些查询作出回应,再由 LLM 评判者将每条回应评估为与策略对齐或不对齐。