论文
CLM 评审:开放对比决策模型的公共基准评估
CLM-as-a-Judge: Evaluating an Open Contrastive Decision Model on Public Judge Benchmarks
摘要
开放对比决策模型是 接近随机水平 作为硬性公共基准的评判:Contrastive-LM/CLM-v0.1-8B 得分在 0.351(四中最佳,随机水平 0.250)和 0.593(成对,随机水平 0.500)之间,在统计上与 RM-Bench 上的硬币翻转没有区别, JudgeBench,并用一个常量标签回答每个 HaluEval 项目,与 0.581 处的简单始终第一基线相匹配。具有相同参数的法官在任何地方的得分都要高得多:奖励模型达到 0.764 到 0.976,生成法官达到 0.611 到 0.778,并且在 Benjamini-Hochberg 校正后,与 CLM 的每一个差距都是显着的。有两个属性确实有效。原始置信度过度自信高达 +0.401,但 保留测试 校准项目上的一个汇总温度拟合可将预期校准误差修复至最多 0.062,并且修复后的置信度在六个基准测试中的三个上将模型自身的误差排名高于 随机水平。生成判断的决策顺序翻转率为 0.0002 对 0.2188,长度偏好偏移为 -0.023 对 -0.217。然而,置信度门控级联将 0.923 到 1.000 的项目升级到预先注册的 0.97 保留栏上的强判断:对接近 随机水平 判断的校准置信度几乎没有什么可保留的。设计:五个公众偏好基准和一个带有真实标签的幻觉基准,在看到任何测试项目之前冻结的预注册下进行评分,对照生成、奖励模型和琐碎基线,并发布每个项目的预测。