论文

DARS:以多次观测的能力分布监督模型路由

From Sampled Outcomes to Capability Distributions: Rethinking Supervision for LLM Routing

AI 基础设施模型网关

摘要

现有的 LLM 路由方法通常从每个查询模型对的单个采样响应构建监督。然而,由于 LLM 的生成是随机的,因此这种观察可能是对模型能力的不稳定估计:语义等效的查询公式和重复解码可能会产生不同的分数,甚至不同的模型偏好。我们表明,这种不稳定性可以进一步从路由标签传播到学习的路由策略。为了解决这个问题,我们提出了 DARS(分布感知路由监督),它通过跨语义保留查询重写和随机解码的重复观察来估计查询级模型能力。 DARS 总结了预期质量、预期成本和性能可变性,以在不改变下游路由器架构的情况下构建风险感知监督。跨不同任务和路由方法的实验表明,与单次监督相比,DARS 通常可以提高路由效用和成本质量权衡。进一步的分析表明,在适度的采样预算和不同的解码温度下,其优势仍然存在。这些结果表明,可靠的 LLM 路由应该超越单个采样结果,而是对查询级能力分布进行建模。