论文

BLADE:边界扩展和层自适应动态退出,实现高效 LLM 推理

BLADE: Boundary-Expanded and Layer-Adaptive Dynamic Exit for Efficient LLM Reasoning

模型推理解码与生成控制

摘要

大语言模型 通常通过生成长推理轨迹来提高任务性能,但由此产生的计算经常浪费在冗余验证和修订上。现有的基于探测的提前退出方法主要检查明确的自我怀疑表达,而导致许多早期终止机会未被发现。将检查扩展到普通推理边界可以提高覆盖范围,但也暴露了高度多样化的中间状态,其预测信息可能驻留在不同的隐藏层中。我们提出了用于高效 LLM 推理的边界扩展和层自适应动态退出(BLADE),这是一个轻量级框架,通过估计生成的前缀是否足以正确回答来动态终止推理。 BLADE 从句子、自我怀疑和段落边界构建多粒度检查点,并通过重复的答案完成得出稳健的训练标签。它进一步学习信息丰富的探测层的紧凑子集,而不是依赖于所有层的固定选择或昂贵的表示。在推理时,校准的预测与特定于检查点的确认规则相结合,以平衡响应能力和过早退出风险。对五个基准和两个 Qwen3 推理模型的实验表明,BLADE 保留了接近基线的准确性,同时在 Qwen3-8B 上将生成的词元减少了 24.8%,在 Qwen3-4B 上减少了 15.8%。消融研究进一步证实了不同检查点和自动层选择的好处,展示了一种实现更高效 LLM 推理的有效方法。