论文
LLM 中的压力测试欺骗探针:欺骗性表示的缩放比例、鲁棒性和几何形状
Pressure-Testing Deception Probes in LLMs: Scaling, Robustness, and the Geometry of Deceptive Representations
摘要
在 LLM 激活上训练的线性探针越来越多地被提议作为欺骗检测指标,但在干净的基准上报告 AUROC 超过 0.96,而在分布偏移下崩溃。本文系统地对 Gemma 3 模型系列(1B-27B 参数)中基于探针的指标进行压力测试,诊断它们失败的原因,而不仅仅是记录它们失败的情况。我们测试关于欺骗编码的四个假设:(1)单线性方向,(2)多维子空间,(3)凸圆锥包,(4)熵代理。我们的设计包括跨域转移矩阵、具有排列零基线的多维探测分析、熵残差测试以及跨 8 个风格转变的干扰评估。我们发现:(a) 探针在干净的数据上实现了近乎完美的 AUROC (>=0.998),但在风格转变下崩溃了;风格增强探针对看不见的风格恢复了近乎完美的检测(平均 AUROC 0.979-0.983); (b) 单向假设被拒绝(k=1 仅捕获 0.61-0.80 AUROC),跨域传输失败被确认为几何驱动而不是层不匹配驱动; (c) 拒绝熵代理假设(max |rho|=0.454,残差后最大 Delta-AUROC=0.004); (d)欺骗不会形成显着的线性子空间(每个域k*=0),但多维探针(k>=5)通过分布式亚阈值特征恢复信号。探针的脆弱性反映了分布的狭窄性,而不是架构的限制:风格增强的探针在 4B 和 27B 上恢复了近乎完美的检测,证明逆缩放模式是训练分布伪影,而不是真正的依赖于尺度的现象。