论文

通过激活匹配微调检测 LLM 中的隐藏行为

Detecting Hidden Behaviors in LLMs via Activation-matched Finetuning

模型评测评测方法与指标

摘要

大语言模型 可以隐藏仅在狭窄条件下激活的隐藏行为,例如后门触发器、卧铺代理部署提示、沙袋或主题条件审查。如果事先不知道要寻找什么,则很难检测到此类行为。我们提出了激活匹配微调,这是一种无监督检测方法,假设不知道触发器或目标行为。给定一个可疑模型和一个公开可用的锚点,我们对锚点进行微调,以在小型良性语料库上重现嫌疑人的激活,并根据两个模型之间的残差对每个评估提示进行评分。由于没有良性语料库覆盖稀疏触发区域,因此参考学习良性计算而不是隐藏行为。因此,触发提示——最重要的是,它们的语义邻居——会产生大量残差,向防御者表明存在异常行为。在第三方模型和自定义模型上测试我们的方法,激活匹配的微调可靠地表面隐藏的行为。此外,我们凭经验考虑自然防御感知攻击,并证明它无法在不牺牲行为本身的情况下抑制我们的检测方法。