论文
答案条件思维链降低了 大语言模型 中的可验证推理 蒸馏
Answer-Conditioned Chains of Thought Degrade Verifiable-Reasoning Distillation in Large Language Models
摘要
提炼 大语言模型 (LLM) 推理能力的标准方法是从模型中抽取思想链,保留那些达到正确最终答案的思想链,并对幸存者进行微调。当采样失败时,常见的修复方法会向生成器显示标准答案,并要求它编写一条达到该答案的链。我们表明,第二步会以正确性过滤无法捕获的方式降低训练数据的质量。我们进行了一项受控实验,修复了生成器、问题集和正确性过滤器,并且仅改变链是否在答案条件下生成,标准答案显示为达到它的请求。在其自己的答案条件链上训练强大的指令调整推理模型会大大降低其可验证推理的准确性。损失随着难度的增加而增加,在最难的比赛问题上损失高达 27 分左右。该机制在链条本身中是清晰的,它从显示的答案向后进行合理化,而不是推导它,以早期的最终答案陈述作为可测量的症状。危害是数据的属性而不是生成器的属性,在任何 微调 之前读取未标记的世代,对来自四个家庭的八个思维模型进行惩罚,并在教师家庭之间转移。及时的消融将其定位于合理化的指导,而不是答案的赤裸裸的可见性。实际的收获是生成盲目答案,因为没有正确性过滤器可以看到数据中的这种损坏。