论文

相同的结果,不同的读数:大语言模型中可操纵的价方向代表什么?

Same Outcome, Different Readout: What Does a Steerable Valence Direction in LLMs Represent?

模型评测模型行为与机制分析

摘要

可解码性和成功的激活引导本身并不能确定内部方向所代表的含义。这种差距对于福利相关的解释尤其重要,其中提出的功能状态必须与提取对比的相关特征区分开来。我们在迷宫任务中研究这个问题的好坏结果方向,使用受控干预措施将实现的结果与已知的信息历史分开。在多个 LLM 检查点中,适合一个显式结果编码的方向可以很好地转移到另一个,这表明读数与表面形式无关。相比之下,当通过已宣布和未宣布的历史达到相同的实现结果时,转移会大大降低:即使在两个历史都收到相同的明确结果之后,事件后的读数仍然强烈依赖于先前的宣布。在匹配的迷宫 RL 运行中,后 RL 方向变得更加能预测参考 MDP 剩余回报,并且策略在测试站点变得更加依赖它,而这种历史依赖性仍然存在。这些结果支持对方向的功能性、与值相关的解释,但不支持其与历史不变的标量价态的识别。