论文

PeerRank:通过网络证据支撑、偏差受控的同行评审实现 LLM 自主评估

PeerRank: Autonomous LLM Evaluation Through Web-Grounded, Bias-Controlled Peer Review

模型评测评测方法与指标

摘要

评估大语言模型通常依赖人工编写的基准、参考答案以及人类或单模型判断,这些方法扩展性差、很快过时,且与依赖网页检索与综合的开放世界部署不匹配。我们提出 PeerRank,一个完全自主的端到端评估框架:模型生成评估任务,以类别范围的实时网络基于网络证据的回答它们,评审同伴回答并把密集的同伴评估聚合为相对性能估计,全程无需人类监督或金标准参考。PeerRank 把评估视为多智能体过程,每个模型对称地担任任务设计者、回答者与评审者,同时移除有偏判断。在一项覆盖12个商用模型与420个自主生成问题的大规模研究中,PeerRank 产出稳定、有区分度的排名,并揭示可测量的身份与呈现偏差。排名稳健,且同伴平均分与 Elo 一致。我们进一步在 TruthfulQA 与 GSM8K 上验证 PeerRank,同伴分数与客观准确率相关。这些结果共同表明,带偏差感知的同行评审配合选择性的网络基于网络证据的回答,可以把开放世界的 LLM 评估扩展到静态与人工策划基准之外。

PeerRank:通过网络接地、偏差受控的同行评审实现 LLM 自主评估
图1:完全内生的 PeerRank 评估流水线(无人类输入)。模型生成问题、以网络为依据作答、在偏差控制协议下评估同伴,并将分数聚合为排名与偏差指标。我们还在 TruthfulQA [14] 上运行 PeerRank,并将同伴评分与客观准确率相关联,以验证真实世界的真实性。