论文
说谎前三思:推理如何提高诚实度
Think Before You Lie: How Reasoning Improves Honesty
摘要
现有LLM评估虽测量欺骗率,但诱发欺骗行为的底层条件仍知之甚少。我们用全新的现实道德权衡数据集研究该问题,其中诚实需付出可变代价。与人类获得深思时间后更不诚实相反(Capraro 2017;Capraro等2019),我们发现推理在多个规模与多个LLM家族中一致提升诚实度。该效应不只是推理内容的函数,因为推理轨迹对最终行为的预测力往往很差。相反,我们证明表示空间自身的底层几何也促成该效应。具体而言,空间中的欺骗区域是亚稳态的:与诚实答案相比,欺骗答案更容易被输入改写、输出重采样与激活噪声去稳定化。依此视角解读推理的作用:在道德推理中生成深思词元意味着穿越有偏的表示空间,最终把模型推向更稳定、更诚实的默认状态。
