论文
CollabEval:通过多智能体协作增强LLM-as-a-Judge
CollabEval: Enhancing LLM-as-a-Judge via Multi-Agent Collaboration
摘要
大语言模型(LLM)革新了AI生成内容的评估,LLM-as-a-Judge范式日益流行。然而,当前单LLM评估方法面临显著挑战,包括判断不一致和预训练数据带来的固有偏见。为解决这些局限,我们提出CollabEval,一个新颖的多智能体评估框架,实现三阶段协作评估流程:初始评估、多轮讨论和最终裁决。与依赖竞争性辩论或单模型评估的现有方法不同,CollabEval强调多智能体间的协作,并通过策略性共识检查保证效率。我们的大量实验表明,CollabEval在多个维度上持续优于单LLM方法,即使在个别模型表现不佳时也保持稳健性能。该框架为各种评估标准提供全面支持,同时通过其协作设计确保效率。
