论文

循环 Transformer 内部状态中的关系偏好编码

Relational Preference Encoding in Looped Transformer Internal States

模型评测模型行为与机制分析

摘要

我们研究循环 Transformer 如何编码人类偏好,在 Anthropic HH-RLHF 上的冻结 Ouro-2.6B 循环迭代状态上训练轻量级评估器头。 v2:前面有勘误;原稿未变。出版后审计发现,三个标题结果因两个独立评估错误而被夸大。 95.2% 的成对评估器准确度是一个规范排序工件:数据被正确分割,但评估器学会了更喜欢第一个提出的论点;它在完整的 8,552 对测试集上的严格反对称准确率为 63.9%。 84.5% 的成对探测和低于概率的 21.75% 点式探测是源项泄漏(方向行和配对伙伴穿过训练/测试分割);校正后的配对不相交值为 56.5% 和 54.2%——高于概率,因此“极性反转”的发现被撤销。核心发现在较小的程度上仍然存在:偏好的关系解码比逐点解码更准确(配对+2.3点,95%CI [+1.3,+3.3]),并且反对称评估器仍然击败线性探针,但没有校正的读数可以与端到端奖励模型相媲美。方法论结果成立(恒定输出简并、翻转测试、交换协议度量通货紧缩),并进行一项修正:反对称精度,而不是反对称相关性,证明了关系歧视。这两个错误是相互不可见的——分割审计无法看到先前的排序,反对称化无法看到泄漏——因此这两项检查都是必需的。后续工作全面审核(麒麟2026,筹备中)。