论文

随机解码下,事后最优路由究竟测量了什么?

What Does a Routing Oracle Measure Under Stochastic Decoding? Coupling, Scorer Choice, and Single-Commit Ceilings

模型评测评测方法与指标

摘要

路由基准常比较两种不同决策:生成前只选择一个模型,与事后在已记录的多个输出中选择任一正确答案。随机解码下两者属于不同决策类别。对固定查询—模型—解码器—评分器协议中的成功概率p_im,论文区分知道各模型成功概率后单次选择的上限R_i=max_m p_im、模型独立生成时至少一个成功的概率U_i=1−∏_m(1−p_im),及二者差值Δ_i。仅凭边际概率,可确定至少一个成功概率的区间[R_i,min(1,Σ_m p_im)];某些相容采样耦合可使差值为零,并不意味着实际部署差值为零。论文检查11个开放模型在GSM8K、MATH-500和GPQA-Diamond上,每个查询—模型组合的30条存档响应。全部候选模型池的展示评分通道下,独立生成差值分别为0.371、3.542和5.100个百分点;由经验边际概率得到的区间为[0,0.473]、[0,4.787]和[0,7.744],零下界来自代数关系。保留的评分器、八种有限采样路径及2,047个非空候选子池反映评分、估计和候选池敏感性,并非置信区间。GSM8K和GPQA展示评分器是在有限查看输出后开发的;独立回顾性留出策略示例只实例化差距分解,没有证明新数据泛化。有限人工检查仅在明确一致的子集上支持评分一致性,哈希绑定材料支持数字核对而非端到端复现。贡献是明确解读事后最优差距所依赖的采样耦合、决策类别、评分器、模型池与采样次数,不能将其直接当作总体效应或等成本路由收益。