论文

后置推理:零成本提升非思考模型的性能

Post Reasoning: Improving the Performance of Non-Thinking Models at No Cost

模型推理推理策略与问题分解

摘要

随着大语言模型 (LLM) 的广泛采用加速,中间推理跟踪的令牌消耗越来越多地导致推理延迟和运营成本。最近的研究表明,许多现实世界的任务几乎不需要或不需要明确的推理,额外的推理有时甚至会降低性能。在这项工作中,我们提出了 \textbf{Post-Reasoning},这是一种简单而有效的方法,可以通过在生成最终响应后调整模型以证明其答案的合理性来改进指令调整模型。通过设计,它可以在没有额外延迟或令牌成本的情况下获得最终答案,同时仍然通过简单的指令增强来提高性能。我们评估了\(117\)模型的后推理——基准设置涵盖\(13\)开放和专有模型、\(4\)模型系列以及\(9\)不同的推理和知识密集型基准,包括AMC、HMMT、GSM8K、GPQA、MMLU-Pro和BIG-Bench Hard。后推理提高了超过 \(88.19\%\) 的评估设置的性能,实现了 \(17.37\%\) 的平均相对改进。此外,我们提出了有监督的事后推理调整,进一步提高了超过 \(91.11\%\) 的评估设置的性能,并且平均超过基于提示的事后推理基线 \(8.01\%\),这表明事后推理可以通过训练有效地内化。最终,后推理为直接回答能力建立了新的性能上限。