论文
超越说谎者长椅:谎言类型、深度与稀疏性对LLM欺骗检测的影响
Beyond Liars' Bench: The Impact of Lie Typology, Depth, and Sparsity on Deception Detection in LLMs
摘要
训练探针检测大语言模型的欺骗性输出仍是开放问题。近期工作证明检测探针在域外场景尤其失效——在一种谎言上训练不能很好迁移到涉及其他类型谎言的欺骗场景。本工作系统研究各因素如何影响检测表现:表示深度、探针表达力、稀疏特征表示与训练数据的谎言类型学。为此,我们以包含多样欺骗类型的补充数据集增强标准基准训练数据,含捏造、隐瞒与夸大样例。跨七种探针类型分析这些因素,实验结果显示:最优表示深度高度依赖数据集;更具表达力的探针相对线性基线只提供选择性增益;稀疏自编码器特征与稠密隐状态表现相近。最终我们证明训练数据与谎言类型学的选择实质改变可检测性——凸显欺骗检测是高度表示依赖的问题。