论文

多 LLM 路由的不可解上限:评测偏差的实证研究

Unsolvability Ceiling in Multi-LLM Routing: An Empirical Study of Evaluation Artifacts

模型评测评测方法与指标

摘要

跨多个 LLM 的高效路由通过将查询定向到最便宜的功能模型来实现成本质量权衡。先前的工作将路由余量归因于“不可解决的上限”,池中没有模型可以解决的查询。我们使用 Gemma 4 和 Llama 3.1 系列对多层 LLM 路由进行了大规模研究,涉及六个基准测试(MMLU、MedQA、HumanEval、MBPP、Alpaca、ShareGPT)的 206,000 个查询模型对。使用 LLM-as-a-judge 和精确匹配指标进行评估,我们发现报告的不可解决性的很大一部分源于评估工件:(i)系统性的法官偏见倾向于冗长而不是正确性,(ii)固定生成预算下的截断,以及(iii)输出格式不匹配。通过双判断验证和精确匹配校验,我们减少了跨任务的测量不可解决性。我们引入了一个分解框架,将失败归因于这些工件,揭示了跨领域和模型系列的一致模式。这些工件还会扭曲路由器训练信号:标准路由器崩溃为多数类预测(~79% 最小层最优),通过随机特征和洗牌标签控制确认,导致 13-17 个百分点的机会成本。我们提供可行的建议,包括双评判验证、精确匹配锚定和成本敏感目标。我们的研究结果表明,现有的路由余量估计值大幅夸大,这凸显了多 LLM 系统中可靠评估协议的需求。