论文
PyroDash:经济高效的 词元级 Small-大语言模型 协作推理
PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference
摘要
大语言模型 (LLM) 提供强大的推理能力,但大规模服务的成本昂贵,而小语言模型 (SLM) 更便宜,但在困难问题上可靠性较差。我们推出 PyroDash,这是一种用于 词元级 SLM-LLM 协作推理的成本感知框架。在生成过程中,SLM 决定是否通过发出控制词元来请求帮助。然后,协作引擎将查询和部分推理跟踪发送到冻结的 LLM,以便通过单次切换完成。该策略内化在 SLM 中,既不需要单独的路由器、LLM 重新训练,也不需要访问 LLM logits。 PyroDash 分三个阶段训练 SLM:控制词元嵌入学习、面向卸载的监督 微调 以及与组相对策略优化的成本感知对齐。其奖励平衡了答案准确性与仅通过 LLM 推理标准化的推理成本。在五个数学推理基准中,PyroDash 支持不同的精度成本操作点。当 $λ=0.05$ 时,它的平均准确度为 64.04%,比仅使用 LLM 的基线高出 6.36 个百分点,同时成本降低了 20.4%。当 $λ=0.6$ 时,它的准确率达到 54.55%,LLM 词元比率为 1.90%,每个示例有 0.012 个 LLM 调用,将总成本从 49.36 美元降低到 1.78 美元。这些结果表明,学习到的 词元级 切换可以减少 LLM 使用,同时保持强大的推理性能。