论文
Tandem:大小语言模型协同共驾,实现高效推理
Tandem: Riding Together with Large and Small Language Models for Efficient Reasoning
摘要
大语言模型(LLM)的最新进展催生了推理密集型推断范式的兴起,即模型在生成最终答案之前进行显式的逐步推理。虽然这类方法提升了答案质量与可解释性,但由于生成序列被拉长,它们带来可观的计算开销。本文提出Tandem,一种新颖的协作框架,协同大语言模型(LLM)与小语言模型(SLM),以显著降低的计算成本实现高质量推理。具体而言,LLM充当战略协调者,高效生成一组精炼的关键推理洞见。这些洞见随后被用于引导更小、更高效的SLM执行完整推理过程并给出最终回答。为平衡效率与可靠性,Tandem引入一种成本感知终止机制,自适应地判断何时已积累足够的推理引导,从而实现LLM生成的提前停止。在数学推理与代码生成基准上的实验表明,与独立LLM推理相比,Tandem将计算成本降低约40%,同时取得更优或具竞争力的性能。此外,在一个领域训练的充分性分类器无需再训练即可有效迁移到其他领域。代码见:https://github.com/Applied-Machine-Learning-Lab/ACL2026_Tandem。
