论文
GAVEL:通过激活监控迈向基于规则的安全
GAVEL: Towards rule-based safety through activation monitoring
摘要
大语言模型 (LLM) 越来越多地与基于激活的监控相结合,以检测和防止表面文本级别可能不明显的有害行为。然而,现有的激活安全方法在广泛的误用数据集上进行训练,但精度较差、灵活性有限且缺乏可解释性。本文介绍了一种新的范例:基于规则的激活安全,其灵感来自网络安全中的规则共享实践。我们建议将激活建模为认知元素(CE)、细粒度的、可解释的因素,例如“发出威胁”和“支付处理”,这些因素可以组合起来以更高精度捕获微妙的、特定领域的行为。在此表示的基础上,我们提出了一个实用的框架,用于定义 CE 上的谓词规则并实时检测违规行为。这使得从业者能够配置和更新防护措施,而无需重新训练模型或检测器,同时支持透明度和可审计性。我们的结果表明,基于组合规则的激活安全性提高了精度,支持域定制,并为可扩展、可解释和可审计的人工智能治理奠定了基础。我们将发布 GAVEL 作为开源框架,并提供随附的自动规则创建工具。
