论文
有限监督下重审思维链推理:半监督思维链学习
Revisiting Chain-of-Thought Reasoning under Limited Supervision: Semi-supervised Chain-of-Thought Learning
摘要
思维链(CoT)推理已成为激活大语言模型潜在推理能力的有效方法。但多数既有CoT方法主要将推理链用作推理时提示——而生成的推理踪迹很少被复用为半监督学习信号。本报告中——我们定义半监督思维链学习——并提出Semi-CoT——简单框架:用无标注问题构造伪推理监督。Semi-CoT为每个无标注问题采样多个伪CoT——估计答案级语义熵——并选择低熵推理链作为可靠的伪CoT示范。这将CoT的自我训练视角从推理时精化扩展到半监督伪监督。在AQuA、SVAMP、GSM8K与MultiArith上的试点实验表明:熵门选出高精度伪CoT——伪答案精度从91.36%到100%。Semi-CoT还在SVAMP与GSM8K上带来小幅增益——AQuA出现负迁移——MultiArith达到天花板。这些结果表明无标注问题可提供可靠的伪推理信号——但其有效利用仍需更强的示范选择或学生训练。