论文

显式建模裁判偏差以减少无效 LLM 比较

Accounting for Bias Enables Sustainable LLM Evaluation

模型评测评测方法与指标

摘要

大语言模型作为法官已成为可扩展的主观评估的事实上的标准,但当前的排行榜通过运行更多的比较来补偿系统测量偏差,这种方法在统计上既不合理,又浪费计算。根本原因是不完整的测量模型,将大语言模型法官视为中立的、可互换的工具,忽略了记录在案的偏见,如位置偏差、冗长偏见、裁判严苛程度和自我偏好,而这些偏见是任何额外数据都无法消除的。我们提出了一个统一的潜在变量框架,该框架联合建模成对数据和序数数据,同时明确纠正这些混杂因素,从大幅减少的比较中恢复可靠的排名。由于相对于单轮 LLM 推理,拟合此模型的计算成本可以忽略不计,因此偏差校正不仅在统计上更加严格,而且也是一种更可持续的可信评估方法。