论文
动态混合精确路由,实现高效的多步骤 LLM 交互
Dynamic Mix Precision Routing for Efficient Multi-step LLM Interaction
摘要
大语言模型(LLM)通过测试时的多步骤交互和推理,在长期决策任务中实现了强大的性能。虽然从业者普遍认为更高的任务成功率需要使用更大更强的 LLM 模型,但与大型 LLM 的多步骤交互会产生过高的推理成本。为了解决这个问题,我们探索在长期决策过程中使用低精度量化LLM。基于对交互步骤之间不同敏感性的观察,我们提出了一种动态混合精度路由框架,该框架在每个决策步骤中自适应地在高精度和低精度 LLM 之间进行选择。该路由器通过两阶段管道进行训练,包括基于 KL 散度的监督学习,用于识别精度敏感的步骤,然后是组相对策略优化 (GRPO),以进一步提高任务成功率。 ALFWorld 上的实验表明,与单精度基线和启发式路由方法相比,我们的方法在准确性与成本权衡方面取得了巨大改进。
