论文
COMPASS:评估 LLM 组织特定政策遵循性的框架
COMPASS: A Framework for Evaluating Organization-Specific Policy Alignment in LLMs
摘要
随着大型语言模型被部署到从医疗到金融的高风险企业应用中,确保其遵循组织特定政策已变得至关重要。然而,现有安全评测仅关注普遍性危害。我们提出 COMPASS(Company/Organization Policy Alignment Assessment),首个评估 LLM 是否遵守组织允许清单与禁止清单政策的系统框架。我们将 COMPASS 应用于八个多样的行业场景,生成并验证 5,920 条查询,通过策略性设计的边界案例测试常规合规与对抗鲁棒性。在评测七个最先进模型后,我们发现一个根本性的不对称:模型能可靠处理合法请求(准确率超过 95%),但在执行禁止事项上灾难性失败,对对抗性禁止清单违规仅拒绝 13%—40%。这些结果表明,当前 LLM 缺乏政策关键部署所需的鲁棒性,COMPASS 由此成为组织 AI 安全的一项重要评测框架。
