论文
发散解码:免训练的能力融合
Divergence Decoding: Training-Free Capability Fusion
摘要
尽管大语言模型擅长推理,这些通才模型往往缺乏专门科学领域的知识;反过来,领域模型(专才)虽然知识丰富,却饱受专业化副作用的困扰,包括逻辑能力下降与鲁棒性降低。为解决这一困境,我们提出Divergence Decoding,一个免训练的能力融合框架。它把推测解码(speculative decoding)的“起草-验证”骨架重构为一种自适应路由机制。其核心是利用Jensen-Shannon散度在每个token处监测两个模型之间的分布分歧。当专家模型表现出显著发散时,我们的方法将其识别为潜在的推理风险,并立即把控制权交给通才模型。这样既保留了领域专长,又能动态注入通用推理能力,实现通才与专才在推理时的策略组合。我们在具有挑战性的科学基准(GPQA、ChemBench和ChemCoTBench)上、跨多个模型家族(Qwen与Llama系列)评估Divergence Decoding。实验结果表明,Divergence Decoding优于领域专精模型和通用模型,有效超越了大多数单模型基线的性能。这表明Divergence Decoding提供了一种通用的免训练范式,通过自适应的推理时协作来融合多样的LLM能力。
