论文

反转护盾:从策略规范系统性生成安全测试

Inverting the Shield: Systematically Generating Safety Tests from Policy Specifications

模型评测安全与风险评测

摘要

大语言模型(LLM)的广泛集成需要严格而系统的安全评估。现有范式要么依赖构建好的基准从预定义视角评估安全性,要么采用动态红队测试探测潜在漏洞。这些方法虽然有效,却面临挑战:它们严重依赖专家领域知识,系统性保证有限,且容易迅速过时。为解决这些局限,我们提出新框架POLARIS,将基于规范的软件测试的严谨性引入AI安全。POLARIS首先将非结构化的自然语言策略编译为一阶逻辑(FOL)表示,在高层规则与具体测试用例之间建立可追溯的关联。这种形式化使构建语义策略图成为可能,其中复杂的策略违规场景被编码为可遍历的路径。通过系统地探索该图,POLARIS发现组合式违规模式,随后将其实例化为可执行的自然语言测试查询,从而实现以覆盖率为驱动且可复现的安全测试。实验表明,与既有基线相比,POLARIS取得更高的策略覆盖率和攻击成功次数。至关重要的是,通过连接形式化方法与AI安全,POLARIS提供了一种有原则的自动化途径,以可验证的可追溯性确保LLM遵守安全关键策略。我们在 https://github.com/huac-lxy/POLARIS 发布代码。

反转护盾:从策略规范系统性生成安全测试:论文配图
图 1:POLARIS 概述。 (1) 策略到逻辑编译:解析非结构化的自然语言策略文本以提取实体和关系,然后将其形式化为逻辑公理的知识库 (KB),称为抽象违规模板 (AVT)。 (2) 语义图构建:知识库中的组件用于构建统一的语义图,然后通过添加推断的语义链接的丰富过程来密集化该语义图。 (3)查询实例化:在丰富的图上进行随机游走,发现结合不同场景的违规路径(例如,涉及“虐待”导致“自杀”),然后将其实例化为具体的有害查询。