论文

JuryFlow:分歧引导的人在环多智能体评估

JuryFlow: Disagreement-Guided Human-in-the-Loop Multi-Agent Evaluation

模型评测评测方法与指标

摘要

大语言模型(LLM)越来越多地被部署为人工智能生成内容的自动评审,但单个评审是不可靠的,甚至一个评审小组也会留下严重的残留物:当评审意见不一致时,多数投票会放弃冲突而不是解决冲突。我们提出了 JuryFlow,这是一种以分歧为导向的人机交互多智能体评估框架,它不会将评审间的分歧视为需要平均消除的噪音,而是将其视为精确的索赔级信号,表明评估的不确定性。 JuryFlow 将每个候选响应分解为原子声明,让一组异构评审分配每个声明的裁决,并构建一个分歧图,其节点由裁决熵评分,其边缘编码声明之间的结构相似性。人类充当结构指南,通过单一的、最小的干预来选择要解决的分歧,而不是重新标记响应,之后重新评估焦点主张,修正沿着图边缘和历史上类似的案例传播,并具体化为所有评审继承的可重复使用的标题条目,使评估者逐渐自我完善。为了在无需人类研究的情况下实现大规模、可重复的基准测试,我们在自动配置中评估 JuryFlow,其中通过熵排序进行焦点选择。在 MT-Bench 和 LLMBar 上,JuryFlow 在单评委和多数投票小组基线上提高了与金标签的一致性,并且消融隔离了针对分歧的重新评估、传播和标题归纳的贡献。我们贡献了(1)一个人机循环范式,将人类从贴标签者重塑为结构指南,(2)JuryFlow框架通过分歧图、焦点重新评估和闭环标题归纳对其进行操作,以及(3)一个评估协议,其中包含隔离收益来源的消融。