论文

GAVEL:通过激活监控迈向基于规则的安全

GAVEL: Towards rule-based safety through activation monitoring

模型推理推理验证与自校正

摘要

大语言模型 (LLM) 越来越多地与基于激活的监控相结合,以检测和防止表面文本级别可能不明显的有害行为。然而,现有的激活安全方法在广泛的误用数据集上进行训练,但精度较差、灵活性有限且缺乏可解释性。本文介绍了一种新的范例:基于规则的激活安全,其灵感来自网络安全中的规则共享实践。我们建议将激活建模为认知元素(CE)、细粒度的、可解释的因素,例如“发出威胁”和“支付处理”,这些因素可以组合起来以更高精度捕获微妙的、特定领域的行为。在此表示的基础上,我们提出了一个实用的框架,用于定义 CE 上的谓词规则并实时检测违规行为。这使得从业者能够配置和更新防护措施,而无需重新训练模型或检测器,同时支持透明度和可审计性。我们的结果表明,基于组合规则的激活安全性提高了精度,支持域定制,并为可扩展、可解释和可审计的人工智能治理奠定了基础。我们将发布 GAVEL 作为开源框架,并提供随附的自动规则创建工具。

GAVEL:通过激活监控迈向基于规则的安全
图1:GAVEL 工作流。(1) 定义基于 Cognitive Elements(CE)的规则并指定动作,可选择复用公开规则集。(2) 通过运行目标 LLM 并捕获激活,从私有与公开 CE 数据集 𝒟_c 中收集 CE 激活 H_c。(3) 在 CE 激活数据集 H={H_c} 上训练多标签分类器 g,以检测所需的 CE。(4) 推理时,使用 g 逐 token 识别与规则相关的 CE,并强制执行用户定义的布尔规则。由于规则与 CE 数据集都是文本形式且与模型无关,它们可以跨模型共享与复用,从而随时间提升覆盖率与质量。