论文
推理微调形成持续的潜在策略状态
Reasoning Fine-Tuning Induces Persistent Latent Policy States
摘要
推理专门模型相比基础模型有明显收益,但究竟改善局部词元能力,还是重组整个推理过程,尚不明确。论文将思维链视为切换动力系统 SDS,内部表示在离散潜在策略状态下演变,结合时间感知对比表示学习与离散机制发现,从激活轨迹恢复潜在策略。在四项基准和 1.5B–32B 参数模型上,推理微调模型比基础模型有更丰富的潜在策略组织,转换结构更有区分性,状态利用、持续性与混合程度的变化依赖模型。恢复状态与不同推理阶段的功能专门化一致;控制实验显示该结构不能仅由正确性、表示学习或建模先验解释,而依赖推理轨迹的连贯时间组织。因果干预中,交换状态降低单步预测拟合,把推理动态移植到基础模型则改善困难推理题。SDS 指导的失败前缀剪枝在十二组模型—数据集设置中的十一组优于自一致性,最高提高 12.5 个百分点。结果支持推理微调重组整体潜在动态的解释。