论文
稳定的推理,不稳定的响应:通过稳定性不对称减轻 LLM 欺骗
Stable Reasoning, Unstable Responses: Mitigating LLM Deception via Stability Asymmetry
摘要
随着大语言模型(LLM)功能和应用范围的扩大,其可信度变得至关重要。一个重要的风险是内在欺骗,其中模型战略性地误导用户以实现自己的目标。现有的基于思想链(CoT)监控的对齐方法可以监督显式推理痕迹。然而,在优化压力下,模型会被激励去隐藏欺骗性推理,从而使得语义监督从根本上变得不可靠。基于认知心理学,我们假设具有欺骗性的 LLM 对其 CoT 保持稳定的内部信念,而其外部反应在扰动下仍然脆弱。我们将这种现象称为稳定性不对称,并通过测量扰动下的内部 CoT 稳定性和外部响应稳定性之间的对比来量化它。基于这种结构特征,我们提出了稳定性不对称正则化(SAR),这是一种新颖的对齐目标,可以在强化学习期间惩罚这种分布不对称性。与 CoT 监控不同,SAR 以模型输出的统计结构为目标,使其对语义隐藏具有鲁棒性。大量实验证实,稳定性不对称性能够可靠地识别欺骗行为,并且 SAR 可以有效抑制内在欺骗,而不会降低一般模型的能力。