论文
知道何时停止:用分段贡献分配减少过度思考
Know When to Stop: Segment-Level Credit Assignment for Reducing Overthinking
摘要
推理语言模型常产生保留判断、放弃方法及自相矛盾等行为,消耗词元而不改善答案。即便控制回答长度,错误轨迹仍比正确轨迹包含更多无效反思,因此不能仅归因于长度。逐步标注反思何时有益成本较高,论文用轨迹中的中间候选答案作为低成本代理:与标准答案比较即可判断后续反思是否有效,无需额外监督。DASH按每个推理片段走向或偏离正确性分配贡献。在过度思考较多的竞赛数学基准中,其平均准确率59.45%,Dr.GRPO为58.1%、GRPO为56.95%,同时减少过度思考并产生更有效的自我纠正。