论文
SafePyramid:面向上下文策略护栏的层级基准
SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing
摘要
在现实应用程序中,护栏通常需要根据特定于应用程序的安全策略来识别不安全的用户模型交互,而不是依赖于预定义的风险分类法。在这项工作中,我们在上下文中的策略护栏范式下研究了这种设置,其中护栏根据上下文中提供的策略规范来预测安全违规行为。为了系统地评估这种能力,我们引入了 SafePyramid,这是一个安全基准,包含跨 10 个域的 1,000 个多轮对话和 3,000 个相应的特定于应用程序的策略,这些策略总共包含 61,699 条不同的自然语言规则。 SafePyramid 将评估分为三个难度级别:L0 评估单个规则的理解,L1 评估规则依赖性的推理,L2 评估上下文中定义的完整新颖策略框架的适应性。为了确保基准测试的质量,我们采用严格的多阶段流程来构建和验证基准测试。使用 SafePyramid,我们评估了 10 个前沿 LLM 和 5 个可配置策略护栏,发现上下文中的策略护栏仍然非常具有挑战性:即使是性能最好的模型 GPT-5.5,在 L0、L1 和 L2 上分别只有 54.0%、35.3% 和 12.9% 的情况下准确识别出全套违反规则。这些结果凸显了当前护栏的局限性,并需要更强大的上下文策略护栏,以可靠地执行策略、解决规则依赖性并适应新的政策框架。
