论文

从协作到能力:将路由式大语言模型专家内化至紧凑推理器

From Collaboration to Capability: Internalizing Routed LLM Experts into Compact Reasoners

摘要

紧凑的控制器可通过选择咨询对象、制定请求并整合其响应来协调更强的专家。我们研究在控制器决策和专家推理及代码学习后,移除专家时生成能力是否提升。我们提出Rivet用于实现"协作内化":专家增强的强化学习为控制器决策和返回的专家跨度提供共享结果信号,验证轨迹内化通过格式感知的监督训练整合完整的成功交互轨迹。部署的控制器可本地使用Python执行,无需外部大语言模型,生成推理、代码和交互结构。在七个竞赛数学基准上,RIVET-1.7B和RIVET-4B的平均准确率分别为28.25%和44.16%;阶段II在移除专家后使RIVET-4B准确率提升6.49个百分点,GPQA-Diamond结果表明其在科学推理上具备泛化能力。消融实验显示,普通轨迹监督和额外格式加权带来性能提升,验证了对验证协作内容与结构进行训练的有效性。

从协作到能力:将路由式大语言模型专家内化至紧凑推理器:论文配图
图2:RIVET训练总览。第一阶段利用共享结果信号,基于控制器决策及专家返回的推理与代码训练控制器;第二阶段通过格式感知监督微调巩固已验证的成功交互。部署后控制器自行生成推理与代码,仅使用本地Python执行,不调用外部LLM。