论文
RLM-Cascade:响应级 推测解码,实现经济高效的 LLM API 服务
RLM-Cascade: Response-Level Speculative Decoding for Cost-Efficient LLM API Serving
摘要
我们提出了 RLM-Cascade,这是一个代理层系统,它在响应级别应用 推测解码 以降低 LLM API 成本,而不需要模型架构访问或共享词汇表。快速、廉价的草稿模型会生成候选回答;一个有能力的验证模型完全取决于轻量级复杂性路由器来接受、增强或绕过。在现实世界的代理编码工作负载 (Claude Code) 上,RLM-Cascade 在 125 个生产请求中实现了 88.8% 的草稿使用率,相对于直接 Opus 基准,将 API 成本降低了 45.8%。与直觉相反,代理还减少了端到端延迟:中位响应时间为 2,026 毫秒,而 Native Opus 为 3,698 毫秒——在 p50 时加速了 1.83 倍——因为 SKIPPED 路径(仅 DeepSeek,无 Opus 调用)主导了工作负载分配。质量符合或超过 Opus 基准:20 项代码/数学/指令基准测试的通过率为 100%,而 Native Opus 的通过率为 95%。我们进一步描述了一种基于规则的复杂性路由器,该路由器为简单的代理轮次选择“SKIPPED”路径,以及一种混合工具调用策略,该策略绕过用于模式关键工具选择轮次的推测管道。 RLM-Cascade 作为企业 AI 基础设施组件部署在生产中,并作为带有实时指标仪表板和 Prometheus 端点的开源版本发布。