论文
通过FusionRoute实现token级LLM协作
Token-Level LLM Collaboration via FusionRoute
摘要
大语言模型(LLM)在多个领域各有所长。然而,要让单一通用模型在这些领域都取得强劲表现,通常需要扩大到训练和部署成本高昂到令人却步的规模。另一方面,较小的领域专用模型虽然效率高得多,却难以泛化到训练分布之外。为解决这一困境,我们提出 FusionRoute,一个稳健且有效的 token 级多 LLM 协作框架:一个轻量路由器在每个解码步同时(i)选出最合适的专家,并(ii)贡献一个互补 logit,通过 logit 相加来修正或纠正所选专家的下一 token 分布。与仅依赖固定专家输出的现有 token 级协作方法不同,我们给出理论分析,表明纯专家路由存在根本局限:除非强的全局覆盖假设成立,否则它一般无法实现最优解码策略。通过用可训练的互补生成器增强专家选择,FusionRoute 扩展了有效策略类,并能在温和条件下恢复最优价值函数。实验上,在 Llama-3 和 Gemma-2 两个系列以及涵盖数学推理、代码生成和指令遵循的多种基准上,FusionRoute 优于序列级与 token 级协作、模型合并和直接微调,同时在各领域专家各自的任务上与它们保持竞争力。
