论文

通过功能归因进行机械异常检测

Mechanistic Anomaly Detection via Functional Attribution

AI 基础设施模型评测AI安全与内容治理基础设施安全与风险评测

摘要

我们通常可以使用 真值 标签来验证神经网络输出的正确性,但我们无法可靠地确定输出是由正常还是异常的内部机制产生的。机械异常检测(MAD)旨在标记这些情况,但现有方法要么依赖于容易受到混淆的潜在空间分析,要么特定于特定的架构和模式。我们将 MAD 重新定义为功能归因问题:询问可信集中的样本在多大程度上可以解释模型的输出,其中归因失败表示异常行为。我们使用影响函数来实现这一点,通过参数空间采样测量测试样本和小参考集之间的功能耦合。我们评估多种异常类型和模式。对于视觉模型中的后门,我们的方法在 BackdoorBench 上实现了最先进的检测,七次攻击和四个数据集的平均防御有效性评级 (DER) 为 0.93(次之为 0.83)。对于 LLM,我们同样在几种后门类型的基线上实现了显着改进,包括显式混淆的模型。除了后门之外,我们的方法还可以检测对抗性和分布外的样本,并区分单个模型中的多个异常机制。我们的结果将功能归因确立为一种有效的、与模态无关的工具,用于检测已部署模型中的异常行为。