论文

发散解码:免训练的能力融合

Divergence Decoding: Training-Free Capability Fusion

模型推理解码与生成控制

摘要

尽管大语言模型擅长推理,这些通才模型往往缺乏专门科学领域的知识;反过来,领域模型(专才)虽然知识丰富,却饱受专业化副作用的困扰,包括逻辑能力下降与鲁棒性降低。为解决这一困境,我们提出Divergence Decoding,一个免训练的能力融合框架。它把推测解码(speculative decoding)的“起草-验证”骨架重构为一种自适应路由机制。其核心是利用Jensen-Shannon散度在每个token处监测两个模型之间的分布分歧。当专家模型表现出显著发散时,我们的方法将其识别为潜在的推理风险,并立即把控制权交给通才模型。这样既保留了领域专长,又能动态注入通用推理能力,实现通才与专才在推理时的策略组合。我们在具有挑战性的科学基准(GPQA、ChemBench和ChemCoTBench)上、跨多个模型家族(Qwen与Llama系列)评估Divergence Decoding。实验结果表明,Divergence Decoding优于领域专精模型和通用模型,有效超越了大多数单模型基线的性能。这表明Divergence Decoding提供了一种通用的免训练范式,通过自适应的推理时协作来融合多样的LLM能力。

发散解码:免训练的能力融合:论文配图
图 1:所提出的分歧解码框架的图示。左:科学任务通常需要细粒度的领域知识和长链推理,这通常分为专业大语言模型和通才大语言模型。右图:我们的方法通过依赖于状态的路由策略弥补了这一差距。通过测量每个步骤 tt 上两个模型之间的分布差异,解码器可以在专家的专业知识和通才的一致性之间动态导航,而无需额外的训练或联合微调。