论文
训练连续思维链模型:两个 regimes 的故事
Training Continuous Chain of Thought Models: A Tale of Two Regimes
摘要
连续思维链方法用一短串稠密潜表示取代冗长的推理轨迹。更早的连续CoT方法间接监督潜表示——使其终态匹配冗长推理轨迹的终态,训练时需要缓慢的自回归生成。我们提出C-MTP,一个更简单、更快的直接监督方法:把每个潜表示建模为被压缩的CoT轨迹中嵌入的平均值。该方法优于一个逼近被压缩token分布的既有直接监督方法,并在现有评估设置(简化CoT轨迹、少于100 token)下与更慢的间接监督方法表现相当。最后,我们把连续CoT方法的评估扩展到更长推理轨迹(数百推理token以上)的复杂任务。我们发现直接与间接监督训练方法在该设置下都表现不佳(性能下降约65%),揭示当前连续CoT方法的局限。代码与检查点发布于https://github.com/Varun221/cmtp_research。
