论文

不归路:语言模型推理中欺骗性承诺的反事实定位

The Point of No Return: Counterfactual Localization of Deceptive Commitment in Language-Model Reasoning

模型评测安全与风险评测

摘要

现有的欺骗数据集将完成的输出标记为诚实或欺骗,将欺骗视为最终响应的属性,而不是模型推理轨迹的函数。这掩盖了一个更基本的问题:语言模型何时会陷入欺骗?我们引入反事实定位:对于推理轨迹中的每个句子前缀,我们修复前缀,重新采样延续,并估计欺骗性结果的概率。为了扩展这一点,我们构建了五种环境(涵盖战略虚张声势、迷宫指导、财务建议、二手车销售和报价谈判),其中欺骗永远不会被提示,而是从战略激励中出现,标签机械地遵循环境状态而不是人类主观判断。生成的语料库在四个推理模型中本地化了 $\sim$1.46M 句子,这些句子来自超过 9410 万个采样延续、91.5B 个生成的标记和超过 10 万个场景。句子级人类评估证实检测到的承诺点对应于决策状态中可解释的转变。使用这个资源,我们表明承诺预测的词汇线索在环境中传递得很差,而基于注意力的转换特征在分布之外泛化,这表明欺骗性承诺反映在推理动态的可重用变化而不是表面形式中。我们进一步确定了紧凑的注意力头集(低于 10% 的头),在一个环境中选择这些头集,会因果性地抑制跨保留环境的欺骗性承诺。我们发布该语料库作为研究语言模型推理中的欺骗以及更广泛的承诺的基础。