论文

大多数 LLM 路由间隙是任务类型

Most of the LLM Routing Gap Is Task Type

模型评测模型行为与机制分析

摘要

LLM 路由器选择应回答每个查询的模型。吸引力在于模型在不同的问题上会失败。无论哪种单一模型总体上最好,仍然会出现一些错误,而池中的另一个模型则可以解决其中的许多问题。每次做出正确的选择就是上限,而路由器就是接近这个上限的尝试。然而,最近的工作报告表明路由器并没有接近。在五个基准测试的 21 种布线方法中,截然不同的设计彼此相差不到一点,而且所有设计都远低于该上限。学习的路由器常常无法击败简单的总是调用最强的模型。我们询问那些被遗漏的问题有什么共同点。我们设置了 14 个模型来回答所有 294 个问题,涉及 3 种语言的 7 种任务类型:韩语、英语和印地语。我们将整个矩阵运行了两次,没有做任何改变,但 4,116 个模型-问题对中,有 5.37% 的得分不同。像这样的连续跑动是正常的,我们认为小胜利并不表明路由做了任何事情,无论是我们的还是其他任何人的。仅当模型在两次运行中都正确时才算正确答案,此矩阵上的 29 个问题可以通过路由进行改进。这里的每个正确答案计数都基于该规则。任务类型占其中大部分:提前为每个任务类型分配一个模型,选择一次并且从不更新,改进了 29 项中的 21 项。按语言拆分每种任务类型又改进了 2 项,并留下 294 项中的 6 项未优化。这少数就是学习路由器的目的,它比上面的运行到运行的运动要小,这是对的共享而不是问题的共享。我们采用的静态表以每次运行 3.33 美元的价格回答了 294 个问题中的 262 个问题,而最佳单一模型则以每次运行 7.69 美元的价格回答了 245 个问题。所有这些都在相同的 294 个问题上进行了拟合和评分,没有任何保留。