论文

CourtGuard:面向 LLM 安全零样本策略适配的模型无关框架

CourtGuard: A Model-Agnostic Framework for Zero-Shot Policy Adaptation in LLM Safety

模型评测评测方法与指标

摘要

当前大语言模型(LLM)的安全机制严重依赖静态的、微调的分类器,存在适应刚性——无法在不进行昂贵再训练的情况下执行新的治理规则。为此,我们提出 CourtGuard,一个检索增强的多智能体框架,将安全评估重构为证据辩论。通过编排基于外部政策文件的对抗辩论,CourtGuard 在 7 个安全基准上取得 SOTA 性能,无需微调即超越专门的策略遵循基线。除标准指标外,我们强调两项关键能力:(1) 零样本适应性——通过更换参考政策,我们的框架成功泛化到域外的 Wikipedia Vandalism 任务(达到 90% 准确率);(2) 自动化数据整理与审计——我们利用 CourtGuard 整理并审计了九个新颖的复杂对抗攻击数据集。我们的结果表明,将安全逻辑与模型权重解耦,为满足当前与未来的 AI 治理监管要求提供了一条稳健、可解释、可适应的路径。

CourtGuard:面向 LLM 安全零样本策略适配的模型无关框架
图1:CourtGuard 框架概览