论文

训练连续思维链模型:两个 regimes 的故事

Training Continuous Chain of Thought Models: A Tale of Two Regimes

模型训练监督微调与指令调优

摘要

连续思维链方法用一短串稠密潜表示取代冗长的推理轨迹。更早的连续CoT方法间接监督潜表示——使其终态匹配冗长推理轨迹的终态,训练时需要缓慢的自回归生成。我们提出C-MTP,一个更简单、更快的直接监督方法:把每个潜表示建模为被压缩的CoT轨迹中嵌入的平均值。该方法优于一个逼近被压缩token分布的既有直接监督方法,并在现有评估设置(简化CoT轨迹、少于100 token)下与更慢的间接监督方法表现相当。最后,我们把连续CoT方法的评估扩展到更长推理轨迹(数百推理token以上)的复杂任务。我们发现直接与间接监督训练方法在该设置下都表现不佳(性能下降约65%),揭示当前连续CoT方法的局限。代码与检查点发布于https://github.com/Varun221/cmtp_research。

训练连续思维链模型:两个 regimes 的故事:论文配图
图 2:C-MTP-X 和 CoT 迹线中按绝对位置划分的自洽表达式分数。我们只绘制 CoT 得出正确答案的样本。 8 月接受 GSM8k 培训,评估:GSM8k 测试。