论文

CollabEval:通过多智能体协作增强LLM-as-a-Judge

CollabEval: Enhancing LLM-as-a-Judge via Multi-Agent Collaboration

模型评测评测方法与指标

摘要

大语言模型(LLM)革新了AI生成内容的评估,LLM-as-a-Judge范式日益流行。然而,当前单LLM评估方法面临显著挑战,包括判断不一致和预训练数据带来的固有偏见。为解决这些局限,我们提出CollabEval,一个新颖的多智能体评估框架,实现三阶段协作评估流程:初始评估、多轮讨论和最终裁决。与依赖竞争性辩论或单模型评估的现有方法不同,CollabEval强调多智能体间的协作,并通过策略性共识检查保证效率。我们的大量实验表明,CollabEval在多个维度上持续优于单LLM方法,即使在个别模型表现不佳时也保持稳健性能。该框架为各种评估标准提供全面支持,同时通过其协作设计确保效率。

CollabEval:通过多智能体协作增强LLM-as-a-Judge
图1:CollabEval 框架由三个主要阶段组成:(a) 阶段 1:初始评估——三名评估者独立评估内容,提供评估结果、置信度分数与理由。执行一致性检查;若达成一致,则返回最终结果,否则进入阶段 2。(b) 阶段 2:多轮讨论——评估者进行协作式讨论,分享一致点、分歧点与理由。每轮结束后执行一致性检查。若达成一致,则返回结果;若未达成,系统在继续之前检查是否已达最大轮数或结果未发生变化。(c) 阶段 3:最终裁决——当通过讨论无法达成一致时,最终裁决者分析此前所有的评估结果、置信度分数、一致/分歧意见与理由,以做出最终评估决策。