论文
写前三思——基于熵的解码策略增强 LLM 推理
Think Twice Before You Write -- an Entropy-based Decoding Strategy to Enhance LLM Reasoning
摘要
解码策略对于塑造大语言模型(LLM)的推理能力起着核心作用。贪婪解码和波束搜索等传统方法经常遭受错误传播的影响,而基于采样的方法引入了随机性,缺乏足够的鲁棒性。自我一致性通过聚合多条采样轨迹来提高可靠性,但会产生大量的计算开销。我们提出了一种熵引导解码框架,将 词元级 自适应性引入到生成中。在每一步中,模型都会计算词元分布的熵,识别高不确定性位置,并有选择地在这些脆弱点上分支。维护和扩展部分生成轨迹的动态池,直到解决方案完成,将计算集中在不确定性最大的地方,并避免在自信区域进行不必要的探索。为了实现高效终止,我们通过在完整推理跟踪后执行熵评估来应用轨迹级熵 </Think> (EAT) 停止标准,而不是在每一步递增。在 GSM8K、AMC2023 及其扰动变体上的实验表明,我们的方法始终保持较高的准确性。值得注意的是,在较小的 LLM 上,性能与 GPT-5 相当,而运行成本仅为 GPT-5 的一小部分。