论文

超越固定方向:LLM 中推理和记忆的自适应表示分析

Beyond Fixed Directions: Adaptive Representation Analysis of Reasoning and Memorization in LLMs

模型评测模型行为与机制分析

摘要

最近的工作提出,语言模型中的推理和记忆可以通过单一表示方向来表征,包括在强化学习期间保持该方向固定的方法。我们测试这个观点背后的两个假设。首先,面向推理和事实回忆的任务组是否近似单向可分离?其次,GRPO 后生成的几何形状是否保持稳定?使用 Qwen3-0.6B 和受控的 400 个示例数据集,我们发现一维投影可以与所研究的任务组上 AUROC = 1.00 的完整 1024 维线性探针相匹配。然而,在GRPO之后,相应的方向被大幅重组:平均方向余弦平均值为0.453,探测方向余弦平均值为0.445,而直接表示漂移在最后一层达到0.511。尽管如此,探测 AUROC 仍然为 1.00。因此,证据支持所研究的任务组的单向可解码性,但对固定方向的稳定性提出了挑战:信息持续存在,而其几何实现发生变化。