论文
JudgeMoE:保留不确定性的 LLM 评分分布聚合
JudgeMoE: Distributional Aggregation for LLM-as-a-Judge
摘要
当 LLM 法官对输出进行评分时,其分数分布保留了标量压缩后丢失的不确定性和分歧信息。我们引入 JudgeMoE,一个轻量级聚合器,它将特定于示例的权重分配给缓存的法官分数分布,并在计算最终分数之前融合它们。一项协议研究表明,评分范围选择在判断数据集设置中不稳定,并且软评分通常优于硬解码。在最初的 10 单元基准测试中,JudgeMoE 通过 $+0.079$ 改进了均匀日志池的平均 Spearman。将相同的配置应用于另外 6 个单元,会产生 $+0.0393$ 平均增益,超过 16 个单元中最强的本地单一判断,在 12/16 单元和单侧 Wilcoxon 符号秩 $p=0.0091$ 中存在正差异。基于验证的分析进一步表明,首选聚合方法取决于任务和判断池。