论文
ReEfBench:量化大语言模型的推理效率
ReEfBench: Quantifying the Reasoning Efficiency of LLMs
摘要
测试时扩展使大语言模型(LLM)能够应对复杂推理,但当前思维链(CoT)评测的局限使人难以分辨性能提升究竟源于真正的推理还是单纯的冗长。为此,(1) 我们提出一种新颖的神经符号框架,用于对推理进行非侵入、全面的以过程为中心的评测。(2) 借助这一视角,我们识别出四种不同的行为原型并诊断其失败模式。(3) 我们考察了推理模式、训练策略与模型规模的影响。我们的分析揭示,延长 token 生成并非深度推理的先决条件。此外,我们揭示了关键约束:在训练中混用长、短 CoT 数据存在过早饱和与崩溃的风险;而蒸馏到更小的模型虽能复制行为长度,却因内在容量限制而无法复制逻辑效能。
