论文

并非所有词元的学习方式都是一样的:注意力熵揭示强化学习推理中的异质信号

Not All Tokens Learn Alike: Attention Entropy Reveals Heterogeneous Signals in RL Reasoning

模型训练强化学习

摘要

基于强化学习的后训练已成为提高大语言模型推理能力的关键方法,但其词元级学习信号仍然知之甚少。这项工作通过注意力熵来研究它们的异质性,注意力熵衡量每个响应标记的上下文支持的集中或分散程度。我们首先证明 词元级 RL 目标是稀疏可估计的:均匀随机的 20% 词元子集保留了大部分完整词元保留的性能,这表明 词元级 更新中存在大量冗余。然而,熵结构子集的行为却截然不同。低注意力熵词元,我们称之为锚点,依赖于集中的支持,产生与全词元更新一致的稳定梯度,并提供可靠的优化主干,但往往会在更难的基准上趋于稳定。高注意力熵标记,我们称之为探索者,聚合更分散的上下文并引发更大但更不稳定的梯度。平均而言,仅限探索者的训练是不稳定的,尽管很少有成功的运行表明,当优化保持稳定时,这些标记可能包含有用的硬推理信号。我们通过证据收集分析、熵动力学、梯度几何诊断和控制来支持这个锚探索者谱,显示位置、预测熵和损失归一化不能解释观察到的不对称性。最后,动态熵感知软重新加权干预将 Qwen3-8B-Base 在最强设置下的保持平均值从 34.39 提高到 37.40。这些发现表明,注意力熵揭示了 词元级 RL 信号中与优化相关的结构,并且统一的标记平均可以掩盖 后训练 推理中有意义的异质性。