论文
CoTJudger:图驱动的LRM思维链效率与冗余自动评估框架
CoTJudger: A Graph-Driven Framework for Automatic Evaluation of Chain-of-Thought Efficiency and Redundancy in LRMs
摘要
大型推理模型(LRM)通过在回答前生成延长的思维链(CoT)展现出强大性能。然而,这一范式常常诱发过度推理:不改善结果却增加计算成本的冗余计算和循环自我验证。现有评估大多强调最终准确率或粗粒度token计数,缺乏将本质逻辑与结构冗余分离的自动化工具。我们提出CoTJudger,一个图驱动框架,通过将自由形式的CoT转换为有向依赖图并提取达到正确解所需的最短有效路径(SEP)来量化推理效率。这产生一个可解释的效率信号——一条CoT中有多少是必要的、多少是结构性冗余的——可跨模型和任务比较。评估21个LRM,CoTJudger揭示出普遍的冗余,并浮现反复出现的失败模式,包括验证执念和补偿性冗余。这些结果为将推理能力与计算浪费解绑提供了实用指标,实现对LRM效率更有针对性的评估与诊断。
