论文

潜在思维链推理的结构过程监督

Structural Process Supervision for Latent Chain-of-Thought Reasoning

模型训练奖励建模与过程监督

摘要

潜在推理方法通过用紧凑的连续空间嵌入替换冗长、显式的思想链(CoT)标记来提高标记级的效率和鲁棒性。然而,现有方法缺乏对这些潜在嵌入的直接过程监督,这通常会导致表示崩溃和信息分布不均匀。为了解决这个问题,我们提出了原型中介过程监督(PMPS),它引入了可学习的推理原型作为语义锚,为潜在推理提供结构过程级监督。 PMPS 将潜在嵌入和显式 CoT 嵌入投影到共享原型空间中,通过原型分配实现不等长表示之间的多对多软对齐。同时,我们引入了渐进顺序对齐(PSA)模块来进一步指导训练:位置先验最初鼓励顺序对齐结构,然后逐渐放松以允许自适应匹配。实验结果表明,PMPS 在 GSM8K-Aug 上将输出Token长度压缩到显式 CoT 的 50% 以下。与领先的基线 SIM-CoT 相比,我们的方法在不同模型系列中的平均准确度提高了 2.08%。在 GPT-2 上,PMPS 甚至超过了 CoT-SFT。在更大的模型和更具挑战性的任务上,PMPS 在具有可比输出长度的所有潜在推理方法中始终获得最高的准确度。