论文
基于共识的 大语言模型 相对偏好评估框架
A Consensus-Based Framework for Relative Preference Evaluation of Large Language Models
摘要
LLM 的传统基准主要依赖于静态数据集和客观评分指标,当多个答案可接受时,这些指标通常无法捕获响应质量的差异。在这种情况下,仅靠正确性不足以区分清晰度、完整性和有用性不同的响应。本文介绍了一种基于共识的评估框架,该框架衡量模型生成的响应之间的相对偏好,而不是绝对正确性。我们不是根据固定的 真值 评估输出,而是评估不同的 LLM 小组如何对同一提示的匿名候选人响应进行排名。这种方法将模型间聚合一致性视为盲条件下感知响应质量的代理。我们使用五个最先进的 LLM 进行了一项跨多个领域的对照研究,包括编程、常识、安全、逻辑推理和数学。每个模型都会生成响应,并通过结构化投票过程独立对同行输出进行排名。分数被汇总成相对智力指数(RII),代表一个模型的响应被其他模型偏好的频率。我们的研究结果揭示了跨领域一致的偏好模式,某些模型更经常被同行排名较高。然而,我们强调这些结果反映了模型间的偏好一致性,而不是客观正确性或人为判断。该框架提供了一种可扩展的、模型驱动的比较评估方法,为存在多个有效答案的场景中的响应质量提供了另一种视角。虽然与人类评估不直接一致,但先前的研究表明,聚合模型偏好可以与人类判断部分相关,从而将其作为代理信号。