论文

机会并非可实现:多 LLM 路由的选择有效诊断

Opportunity Is Not Realizability: Selection-Valid Diagnostics for Multi-LLM Routing

模型评测评测方法与指标

摘要

Oracle 路由测量语言模型池可以从每个查询选择中获得多少收益,但该诊断有两个缺陷:针对同一示例中选择的最佳固定模型进行测试会使配对推理无效,并且全信息预言机无法看到可部署路由器观察到的结果。我们分离三个估计量(结果预言机机会、来自声明的预应答信号的贝叶斯最优增益以及学习路由器的保留增益),并证明选择有效的置信区间,可以选择最佳固定模型或路由器系列的最佳成员、信号信息三明治以及从子模互补覆盖构建紧凑池的 $(1-1/e)$ 贪婪保证。在四个基准的六个系列的八个检查点上,选择有效间隔证明每项任务的人口预言差距为 $9.7$--$30.7$ 点,但最强的可部署提示路由器仅恢复其中的 $7.5$--$14.4\%$,并且十一个测试策略中最好的同时间隔始终具有下限零。预言机机会的可实现份额很小并且是可以证明的:强大的路由器击败了最好的固定模型,并且大部分差距仍然存在。