论文

揭秘隐藏状态循环:使用 同策略 强化学习进行可切换的潜在推理

Demystifying Hidden-State Recurrence: Switchable Latent Reasoning with On-Policy Reinforcement Learning

模型架构递归架构

摘要

潜在思想链通过用连续隐藏状态循环替换可见推理痕迹来压缩推理,但现有的公式很难用标准 同策略 强化学习 (RL) 进行优化,并且很难解释因果关系。我们的主要见解是,一对显式边界词元可以同时解决这两个问题:离散的入口和出口锚点使潜在块与标准 同策略 RL 兼容,并且相同的锚点为机械分析提供了自然的立足点。受此启发,我们提出了 SWITCH,一个可切换的潜在推理框架。模型发出 <swi> 进入潜在模式,并发出 </swi> 退出。由于边界是普通的离散词元,因此 GRPO 策略比率在每个决策点都有明确定义。同样的锚还暴露了直接探索和因果干预的潜在步骤。我们使用可见到潜在课程和 Switch-GRPO 目标来训练模型,该目标通过循环潜在计算传播梯度。在类似规模上,SWITCH 始终优于先前的隐藏状态循环潜在推理方法。通过边界标记进行的机制分析进一步揭示了三个发现:(i)<swi>是一种明显本地化的、学习的切换策略,而不是一种风格人工制品; (ii) 它打开的潜在步骤执行特定于问题的、因果上重要的计算,而不是充当惰性占位符; (iii) 计算集中在进入时的单个隐藏状态转换上。总之,这些结果表明,隐藏状态循环潜在推理既是 RL 可训练的,又可以直接进行机械分析,包括 同策略 RL 本身如何从内部改进模型。