论文

说谎前三思:推理如何提高诚实度

Think Before You Lie: How Reasoning Improves Honesty

模型评测模型行为与机制分析

摘要

现有LLM评估虽测量欺骗率,但诱发欺骗行为的底层条件仍知之甚少。我们用全新的现实道德权衡数据集研究该问题,其中诚实需付出可变代价。与人类获得深思时间后更不诚实相反(Capraro 2017;Capraro等2019),我们发现推理在多个规模与多个LLM家族中一致提升诚实度。该效应不只是推理内容的函数,因为推理轨迹对最终行为的预测力往往很差。相反,我们证明表示空间自身的底层几何也促成该效应。具体而言,空间中的欺骗区域是亚稳态的:与诚实答案相比,欺骗答案更容易被输入改写、输出重采样与激活噪声去稳定化。依此视角解读推理的作用:在道德推理中生成深思词元意味着穿越有偏的表示空间,最终把模型推向更稳定、更诚实的默认状态。

先想再谎:推理如何带来诚实:论文配图
图 2:答案空间示意图:诚实比欺骗占据更大的区域,导致欺骗的路径更少。22 2 使用 https://apps.amandaghassaei.com/gpu-io/examples/fluid/ 构建的示意图