论文

评估 LLM 升级路由信号:目标、对照与五类自欺

Evaluating Escalation Signals for LLM Routing: Targets, Controls, and Five Ways to Fool Yourself

模型评测评测方法与指标

摘要

决定何时将查询从小型语言模型升级到较大的语言模型需要一个廉价的信号,该信号可以在调用大型模型之前预测升级是否有帮助。语义熵最初是为了检测幻觉而开发的,它是一个自然的候选者:它衡量模型的采样答案在含义上的不一致程度,高度不一致通常表明答案不可靠。我们通过三个基准和两个模型系列对其进行测试。在 GSM8K 上,小/大对的大小相差约 12 倍,语义熵可靠地区分小模型的错误 (AUROC 0.871),并以匹配的成本将随机升级的路由准确性提高最多 9 个点。早期的综合基准测试结果被证明具有误导性:仅基于问题难度的简单规则,不涉及模型,几乎完全匹配语义熵。本文的主要贡献是在将其报告为真实情况之前进行一组检查。我们证明,对任何信号进行简单的、仅问题难度估计的评分可以揭示该信号是否添加了真实信息,或者只是跟踪问题看起来有多难; “升级有效”的两个合理定义可能会对相同数据产生截然不同的结果;基准测试几乎不会给任何信号留下任何击败的空间,只需始终使用大型模型;并且实时采样的真实成本可能会使路由比直接调用大型模型更昂贵。对于重用缓存的过去结果的更便宜的替代方案,我们展示了如何预测它是否适用于新数据集 - 通过提前正确预测从 AUROC 0.908 到 随机水平 水平 (0.518) 的崩溃来确认。我们提供这些作为评估升级信号的通用清单。

评估 LLM 升级路由信号:目标、对照与五类自欺:论文原图
图 1:GSM8K 上的成本质量边界($r=0.56$、$\gamma=12$),取自表 10 以及第 3.4 节的成本模型(它提供了 $1$ 单元的always-small 成本;always-small 在表 10 本身中没有行)。始终小和始终大从不路由,因此它们不带有 AUROC,并显示为仅成本参考条。