论文
签名救援路由:用于高效 LLM 推理的危害感知级联
Signed Rescue Routing: Harm-Aware Cascades for Efficient LLM Inference
摘要
大语言模型 (LLM) 级联使用小模型回答简单的请求,并将选定的请求升级到更大的模型。大多数路由器优先考虑小模型看起来不确定或可能错误的示例。这个代理忽略了一个决定性的事实:只有当大模型纠正小模型时升级才有用,而当大模型用不正确的答案替换正确答案时升级是有害的。我们引入了签名救援路由(SRR),这是一种预算路由方法,可以分别预测这两个事件并根据它们的差异对请求进行排名。我们证明这个带符号的条件增益是固定升级预算下的贝叶斯最优路由得分。 SRR在部署时只需要小模型的输出统计,并添加一个轻量级的双头路由器。我们在 MMLU、HellaSwag 和 ARC-Challenge 的 TBD 示例上使用 Qwen3-4B 和 Qwen3-8B 评估 SRR。与学习小模型误差预测器的 TBD 和熵路由的 TBD 相比,在准确度计算曲线上,SRR 达到了 TBD 的区域。这些结果表明,预测增量值而不是模型不确定性是高效 LLM 级联的简单而有效的目标。