论文

动态混合精确路由,实现高效的多步骤 LLM 交互

Dynamic Mix Precision Routing for Efficient Multi-step LLM Interaction

模型优化模型训练强化学习量化RLVRAgentic RL

摘要

大语言模型(LLM)通过测试时的多步骤交互和推理,在长期决策任务中实现了强大的性能。虽然从业者普遍认为更高的任务成功率需要使用更大更强的 LLM 模型,但与大型 LLM 的多步骤交互会产生过高的推理成本。为了解决这个问题,我们探索在长期决策过程中使用低精度量化LLM。基于对交互步骤之间不同敏感性的观察,我们提出了一种动态混合精度路由框架,该框架在每个决策步骤中自适应地在高精度和低精度 LLM 之间进行选择。该路由器通过两阶段管道进行训练,包括基于 KL 散度的监督学习,用于识别精度敏感的步骤,然后是组相对策略优化 (GRPO),以进一步提高任务成功率。 ALFWorld 上的实验表明,与单精度基线和启发式路由方法相比,我们的方法在准确性与成本权衡方面取得了巨大改进。

面向高效多步 LLM 交互的动态混合精度路由
图2:我们的动态混合精度路由框架概览。(a)观察:从量化 LLM 的失败推理轨迹中,我们观察到对模型量化的敏感性存在逐步的多样性:量化模型很可能遇到某些超出其能力的“关键步骤”,最终导致错误的推理结果。(b)路由器训练流程:我们收集高精度的成功 rollout,并从 KL 散度导出二值监督信号,以训练一个轻量的两层 Transformer 路由器,用于预测某个步骤是否对精度敏感。随后使用带代价感知奖励的组相对策略优化(GRPO)进一步精炼路由器,以平衡任务成功与推理效率。(c)在推理时,路由器在每个决策步骤动态地在高精度 LLM 与量化 LLM 之间进行选择。