论文
解码推理中隐藏的欺骗 LLM:欺骗审计的激活解释器
Decoding Hidden Deception in Reasoning LLMs: Activation Explainers for Deception Auditing
摘要
随着LLM获得更强的推理能力,欺骗行为成为越来越严重的安全问题。现有的欺骗监控要么对可见的转录本进行评分,要么从表示向量中得出标量探测分数,几乎没有留下任何可检查的证据来说明为什么响应是可疑的。我们介绍 STATEWITNESS,一种用于欺骗审计的激活解释器。单独的解码器读取目标模型的隐藏状态,然后回答自然语言查询或发出有关它们的结构化报告。我们在七个欺骗数据集的两个目标推理 LLM 上评估 STATEWITNESS。 STATEWITNESS 的平均 AUROC 达到 0.916,在相同的评估协议下,比最佳黑盒文本监视器相对增益 11.6%,比最佳激活探针基线相对增益 25.0%。当与现有监视器结合使用时,STATEWITNESS 可以减少简单阈值集合中遗漏的欺骗性示例。除了标量检测之外,解码器还返回查询级答案、模式报告以及标记或句子级证据跟踪以供人工检查。我们将此接口视为更广泛的可解释性和对齐工具的潜在构建块。