论文
针对多语言LLM路由的预生成成功探针的跨语言校准
Cross-lingual Calibration of Pre-Generation Success Probes for Multilingual LLM Routing
摘要
预生成成功探针在解码之前根据语言模型的隐藏激活估计响应正确性,从而实现成本感知路由。虽然之前的工作主要证明了它们在英语输入上的实用性,但我们从三个维度研究了它们在不同语言中的可靠性:(1)它们是否保留了可能成功和失败的排名(区分能力); (2) 它们是否保留与观察到的成功频率相匹配的概率(校准); (3)它们是否在成本感知多语言路由(UTILITY)的候选模型中产生足够可比的分数。我们使用 10 种语言的 3,000 个数学问题和 8 个开放权重模型配置,比较了英语训练的探针和等预算池化多语言探针的跨语言迁移。经过英语训练的探针保留了有用的跨语言区分能力,但在转移后变得不太好校准。集中的多语言监督可以改善这两个属性并产生更可靠的成功估计。在路由实验中,相对于始终选择平均成功率最高的模型,池化路由器的测试成功率提高了 0.7%,同时建模成本降低了 13.0%。这些结果表明,多语言路由需要成功估计,并且在不同语言和模型之间保持良好的校准和可比性。