论文
RankJudge:多轮 LLM-as-a-Judge 综合基准生成器
RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator
摘要
随着基于 LLM 的交互式应用程序的创建和完善,模型开发人员需要沿着许多可能的轴评估生成的文本的质量。对于更简单的系统,人工评估可能是实用的,但在对话聊天机器人等复杂系统中,生成的文本量可能会淹没人工注释资源。模型开发人员已经开始严重依赖自动评估,其中 LLM 也用于判断生成质量。然而,现有的 LLM-as-a-judge 基准测试主要集中于简单的问答任务,与多轮对话的复杂性不匹配。我们引入了 RankJudge,这是一个基准生成器,用于评估基于参考文档的多轮对话中的 LLM 作为法官。 RankJudge 创建一对对话,其中一个对话在一个回合中注入了一个缺陷。这种结构允许将配对对话明确地标记为更好或更差,并精确地将失败类别与各个回合隔离开来,从而实现严格的联合正确性判断标准。我们在机器学习、生物医学和金融领域实施 RankJudge,评估 21 位前沿 LLM 法官,并通过 Bradley-Terry 模型对这些法官进行排名。我们的公式还允许对每个对话对进行难度评级排名,我们用它来动态管理评估切片以减少标签噪音,正如通过人工注释所确认的那样。我们发现,在部分可观察性、较粗略的正确性标准和替代的随机游走评级算法下,法官排名是稳定的。