论文

LLM 作为法官消除偏差的两种方法:分层贝叶斯校准和神经 ODE 分数传输的连续分数比较

Two Ways to De-Bias an LLM-as-a-Judge: A Continuous-Score Comparison of Hierarchical Bayesian Calibration and Neural-ODE Score Transport

模型评测评测方法与指标

摘要

[节略]使用 大语言模型 (LLM) 作为自动评分者(LLM 作为法官)成本低廉,但可能存在偏见:一些法官宽松,另一些法官严格,规模的中间被压缩,冗长的答案可能会获得过度奖励。一种常见的补救措施是事后校准:将便宜的法官留在原地,并在一组适度的配对锚点上,拟合从原始法官分数到人类评分估计的转换。我们比较了两种对如何建模这种映射持相反观点的校正器:具有每个分数不确定性的参数化小锚分层贝叶斯线性校正,以及非参数神经常微分方程 (FFJORD) 分数传输流。两者都在 UltraFeedbackfine-grained_score(1700 个配对示例,200 个保留)上进行正面交锋,校准分为三个操作子问题:总体平均恢复、每个项目的准确性和分布形状匹配。最重要的结果是,方法之间的选择主要是一个数据预算问题。两个校正器将原始 $+0.71$ 点平均偏移量关闭到 GPT-4 参考的 $\pm 0.08$ 范围内(在 100 和 1500 个锚点处)。除此之外,这些方法会交换角色。使用 100 个锚点,线性校正器通过 KL 散度重建人类得分分布,其性能大约是 KL 散度的两倍(0.031 vs. 0.058),并将流与 MAE 联系起来。有了 1500 个锚点,流程在每个指标上都获胜(MAE 0.320 与 0.359、Pearson 0.922 与 0.896、KL 0.026 与 0.037)。贝叶斯线性校正器在远低于 1500 个锚点时饱和:残余 $\tanh$ 形非线性在结构上是线性校正无法拟合的。随着标签的增长,流程不断改善。我们将这些发现转化为生产部署的明确决策规则。