论文
推理更短,答案更早?推理接口的评估
Shorter Reasoning, Earlier Answers? An Evaluation of Reasoning Interfaces
摘要
大语言模型 通常在回答之前进行详细推理,从而增加成本和延迟。提示和经过训练的设置可以缩短这种推理,但较短的跟踪可能只会表明模型停止得更快。在这里,我们评估了 198 个 GPQA Diamond 问题和 500 个 MMLU-Pro 问题在匹配推理范围内同一问题的配对运行。我们测试了一个数字/简洁提示,该提示宣布了 Qwen3-14B 的词元限制以及 gpt-oss-20b 和 -120b 的训练工作量设置。 Qwen 提示将推理轨迹缩短了 12-17%,而匹配词元限制下的准确度变化很小且参差不齐。简洁/早期回答指令将 MMLU-Pro 在 512 个标记处的准确率提高了 3.8 个百分点,其中在两次运行都未完成时提高了 2.7 个百分点。其 2,048 个词元的涨幅尚不确定。对于 gpt-oss,来自完成的低努力和中等努力推理的候选 logits 答案比匹配范围高努力答案准确 14.5-26.3 分。 512 个词元的优势大部分来自较早完成的较低工作量,而未完成运行之间的差异较小且混合。错误的早期答案通常会将概率集中在所选选项上,因此早期停止并不能一致提高概率质量。在这些测试中,紧迫的截止日期可能有利于减少工作量或简洁的指令,而允许大量努力完成可以恢复更高的最终准确性。评估应报告截止日期之前的正确完成情况、运行停止时获得的答案、未完成运行之间的差异以及分别分配给正确答案的概率。