论文
重新思考 LLM 作为法官的语言信心:2025 年后专有模型的兼容性转变
Rethinking Verbalized Confidence for LLM-as-a-Judge: A Compatibility Shift on Post-2025 Proprietary Models
摘要
长期以来,言语置信度被认为过于自信、粗糙且容易出现整数聚类而被忽视,但现在它已成为 LLM-as-a-Judge 在顶级专有模型上更强大的软评分机制。在 SummEval、AggreFact 和 HelpSteer2 中,跨度高达 18 LLM,我们表明,偏爱对数概率的标准建议不再适用于 2025 年后的模型,在这些模型中,口头表达的信心是更好的信号。我们称之为兼容性转变。在标准的言语自信基线之上,我们引入了两个新成分:过度自信咨询和自我辩论。它们共同改善了校准、分数分布分布以及任务主观性的鲁棒性。我们进一步观察了生成效应:2025 年后的模型在几乎没有平衡精度成本的情况下容纳了这两个附加项,而 2025 年前的模型则付出了可衡量的代价。与基于 logprob 的 G-Eval 相比,言语置信度是 GPT 系列顶级版本上主观性更强的软信号。在只注重准确性的报告中,这种转变是不可见的。我们建议在 LLM-as-a-Judge 中更广泛地使用软评分,而不是默认使用硬预测。更广泛地说,言语信心已经从对数概率的较弱替代品转变为当代 LLM 法官的实用软评分机制。