论文
DECOR:通过信息操纵理论审计 LLM 欺骗
DECOR: Auditing LLM Deception via Information Manipulation Theory
摘要
大语言模型 可以通过巧妙地操纵真实信息(忽略关键事实、转移焦点或模糊含义)来进行欺骗,从而使此类行为难以被发现。现有的黑盒方法依赖于粗粒度的判断,提供的可解释性有限,并且无法查明哪些事实被扭曲以及如何被扭曲。我们介绍 DECOR,一个基于信息操纵理论的多代理框架,用于对 LLM 响应中的战略欺骗进行细粒度审核。 DECOR 将输入上下文分解为原子信息单元,并针对四个操作维度的响应对每个单元进行评分,生成可解释的操作配置文件,这些配置文件聚合成全局欺骗指数。我们在跨越现实世界领域的单轮和多轮欺骗检测基准上全面评估 DECOR,并表明 DECOR 在这两个基准上都实现了最先进的性能,优于竞争基准。该框架概括了 15 个前沿模型,消融研究证实了每个关键设计组件的贡献。我们的研究结果表明,对信息操纵进行细粒度、基于理论的审计为 LLM 欺骗检测提供了有效且可解释的路径。