论文

SafePyramid:面向上下文策略护栏的层级基准

SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing

模型评测上下文与知识上下文工程基准与评测资源

摘要

在现实应用程序中,护栏通常需要根据特定于应用程序的安全策略来识别不安全的用户模型交互,而不是依赖于预定义的风险分类法。在这项工作中,我们在上下文中的策略护栏范式下研究了这种设置,其中护栏根据上下文中提供的策略规范来预测安全违规行为。为了系统地评估这种能力,我们引入了 SafePyramid,这是一个安全基准,包含跨 10 个域的 1,000 个多轮对话和 3,000 个相应的特定于应用程序的策略,这些策略总共包含 61,699 条不同的自然语言规则。 SafePyramid 将评估分为三个难度级别:L0 评估单个规则的理解,L1 评估规则依赖性的推理,L2 评估上下文中定义的完整新颖策略框架的适应性。为了确保基准测试的质量,我们采用严格的多阶段流程来构建和验证基准测试。使用 SafePyramid,我们评估了 10 个前沿 LLM 和 5 个可配置策略护栏,发现上下文中的策略护栏仍然非常具有挑战性:即使是性能最好的模型 GPT-5.5,在 L0、L1 和 L2 上分别只有 54.0%、35.3% 和 12.9% 的情况下准确识别出全套违反规则。这些结果凸显了当前护栏的局限性,并需要更强大的上下文策略护栏,以可靠地执行策略、解决规则依赖性并适应新的政策框架。

SafePyramid:面向上下文策略护栏的层级基准:论文配图
图 1:固定分类法防护和上下文策略防护之间的视觉比较。这两种范式都源自风险分类法,但固定分类法护栏将用户模型交互映射到粗略的风险类别,而上下文中的策略护栏将每个风险类别扩展为在推理时在上下文中提供的明确且可审计的安全策略。此类策略使安全标准透明、可检查、可追踪和负责,同时保持适应特定应用程序的要求。