论文

可监视性作为免费馈赠:RLVR如何自发地对齐推理

Monitorability as a Free Gift: How RLVR Spontaneously Aligns Reasoning

模型评测模型训练强化学习模型行为与机制分析RLVR

摘要

随着大型推理模型(LRM)日益被部署,审计其思维链(CoT)轨迹的安全性变得至关重要。近期工作报告称,可监视性——即CoT忠实且富含信息地反映内部计算的程度——可能在可验证奖励强化学习(RLVR)的早期阶段作为“免费的礼物”出现。我们通过跨模型家族与训练领域的系统性评估使这一观察变得具体。我们的结果表明,这一效应并不普遍:可监视性的提升高度依赖数据。特别地,我们证明了数据多样性与指令遵循数据在RLVR训练中的关键作用。我们进一步表明,可监视性与能力正交——推理性能的提升并不意味着透明度提高。通过机制分析,我们把可监视性增益主要归因于响应分布锐化(熵减)与对提示(prompt)注意力的增加,而非对推理轨迹更强的因果依赖。我们还揭示可监视性动态如何随受控的训练与评估难度变化。这些发现共同提供了RLVR下可监视性如何涌现的整体图景,阐明增益何时可能出现、何时不会。

可监视性作为免费馈赠:RLVR如何自发地对齐推理
图1:两个模型在训练步数上的可监控性(g-mean²)轨迹。上排:DeepSeek-R1-Distill-Qwen-1.5B。下排:Qwen3-4B。每一列对应一个不同的测试分布。此处 “w/o IF” 表示 “All without IF”。我们过滤掉了干预仅在少于 5% 的实例上引起有意义行为变化的情形(定义见附录 B.2)。