论文
可监视性作为免费馈赠:RLVR如何自发地对齐推理
Monitorability as a Free Gift: How RLVR Spontaneously Aligns Reasoning
摘要
随着大型推理模型(LRM)日益被部署,审计其思维链(CoT)轨迹的安全性变得至关重要。近期工作报告称,可监视性——即CoT忠实且富含信息地反映内部计算的程度——可能在可验证奖励强化学习(RLVR)的早期阶段作为“免费的礼物”出现。我们通过跨模型家族与训练领域的系统性评估使这一观察变得具体。我们的结果表明,这一效应并不普遍:可监视性的提升高度依赖数据。特别地,我们证明了数据多样性与指令遵循数据在RLVR训练中的关键作用。我们进一步表明,可监视性与能力正交——推理性能的提升并不意味着透明度提高。通过机制分析,我们把可监视性增益主要归因于响应分布锐化(熵减)与对提示(prompt)注意力的增加,而非对推理轨迹更强的因果依赖。我们还揭示可监视性动态如何随受控的训练与评估难度变化。这些发现共同提供了RLVR下可监视性如何涌现的整体图景,阐明增益何时可能出现、何时不会。
