论文
价值轴:语言模型编码它们是否走在正确的轨道上
The Value Axis: Language Models Encode Whether They're on the Right Track
摘要
我们调查语言模型是否在内部跟踪其当前轨迹的价值,定义为其正在进行的策略实现目标的可能性。使用综合的上下文强化学习数据,我们为 Qwen3-8B 构建了一个“价值”轴。我们发现沿着这个轴的激活区分高和低语言置信度、没有和有回溯的推理轨迹以及正确和损坏的代码。转向高价值会抑制自我纠正并减少解释性的冗长,而转向低价值会导致回溯和探索。我们证明直接偏好优化(DPO)可以增加奖励行为(例如使用某个单词)的内部价值,使模型在展示这些行为后更加自信地行动。最后,我们应用价值轴来研究野外环境。例如,我们发现 Qwen 在 后训练 之后为政治敏感的聊天查询分配了较低的值,并且受监督的 微调 增加了训练领域内的内部信心。我们的结果表明,语言模型线性编码对预期目标成功的估计,从而调节他们追求某个方向的信心。