论文

有效不等于必要:诊断思维链中的潜在低效

Valid $\ne$ Necessary: Diagnosing Latent Inefficiency in Chain-of-Thought

模型评测评测方法与指标

摘要

思维链(CoT)提示显著推进了大语言模型(LLM)的推理能力,但常因过度推理——生成冗余、冗长或无关步骤——产生可观计算成本。既有推理步骤评估器能有效检测逻辑谬误与事实错误,我们的分析揭示一个关键盲点:它们不能惩罚“有效但低效”的推理步骤——膨胀token使用却无助于解题。为系统诊断该局限,我们引入RIV-GSM8K:注入五类不同低效(含循环推理与过度分解)的诊断基准。诊断实验显示最先进的评估器难以把这些低效与必要推理区分开。为弥合该差距,我们提出CAID(上下文感知信息密度):一个扎根信息论的免训练指标,识别低效用步骤。为验证该指标的实用价值,我们把它应用于PACE——一种事后压缩策略。额外对照实验显示PACE的增益不能由简单剪枝解释:与随机步删除及基于PRM的压缩基线相比,它在显著更高的压缩率下保持准确率。GSM8K、StrategyQA与ARC-Challenge上的实证结果表明PACE在保持准确率的同时把token消耗降低31–53%,确认CAID成功从推理链中蒸馏出信息泡沫而不损害演绎有效性。

有效不等于必要:诊断思维链中的潜在低效:论文配图
图 2:CAID 使用的四个信号的概念概述。 (1)局部相似度通过相邻步骤比较来检测表面级冗余。 (2) 全局目标调整通过测量与原始问题的偏差来过滤不相关的步骤。 (3) 信息密度使用长度归一化的困惑度来识别冗长、低熵的步骤。 (4)语义增量量化上下文中的向量移位,确保实质性的逻辑进展。