论文

ReEfBench:量化大语言模型的推理效率

ReEfBench: Quantifying the Reasoning Efficiency of LLMs

模型评测评测方法与指标

摘要

测试时扩展使大语言模型(LLM)能够应对复杂推理,但当前思维链(CoT)评测的局限使人难以分辨性能提升究竟源于真正的推理还是单纯的冗长。为此,(1) 我们提出一种新颖的神经符号框架,用于对推理进行非侵入、全面的以过程为中心的评测。(2) 借助这一视角,我们识别出四种不同的行为原型并诊断其失败模式。(3) 我们考察了推理模式、训练策略与模型规模的影响。我们的分析揭示,延长 token 生成并非深度推理的先决条件。此外,我们揭示了关键约束:在训练中混用长、短 CoT 数据存在过早饱和与崩溃的风险;而蒸馏到更小的模型虽能复制行为长度,却因内在容量限制而无法复制逻辑效能。

ReEfBench:量化大语言模型的推理效率 配图
图 1:我们的框架概览。我们生成可扩展、可控的一阶逻辑(FOL)数据,实现逻辑深度的精确验证(阶段 A)。目标 LLM 为每个查询生成响应(阶段 B)。流水线将目标 LLM 的响应解析为形式化表示(阶段 C),通过基于规则的验证器计算其逻辑深度与正确性(阶段 D),沿逻辑深度、成本、探索性、效率、连贯性与冗余性六个维度评估归一化后的输出,并最终将其归入四种行为原型之一:EffectiveSolver、DeepWanderer、HollowMimic 与 LazyGuesser(阶段 E)。