论文
EntroCoT:通过自适应熵引导分段增强思维链
EntroCoT: Enhancing Chain-of-Thought via Adaptive Entropy-Guided Segmentation
摘要
思维链(CoT)提示显著增强了大型语言模型的数学推理能力。我们发现现有微调数据集经常存在“答案对但推理错”的问题,即正确的最终答案来自幻觉式、冗余或逻辑无效的中间步骤。本文提出EntroCoT,一个自动识别并精炼低质量CoT监督轨迹的统一框架。EntroCoT首先提出一种基于熵的机制,在不确定节点处将推理轨迹切分为多个步骤,然后引入基于蒙特卡洛rollout的机制评估每个步骤的边际贡献。通过准确过滤具欺骗性的推理样本,EntroCoT构建出高质量数据集,使每条推理轨迹中的每个中间步骤都有助于最终答案。在数学基准上的大量实验表明,在EntroCoT构建的子集上微调始终优于全量数据监督的基线。
