论文
(迈向)使用 大语言模型 进行可扩展的可靠自动评估
(Towards) Scalable Reliable Automated Evaluation with Large Language Models
摘要
评估 大语言模型 (LLM) 文本输出的质量和相关性仍然具有挑战性且需要大量资源。现有的自动化指标通常无法捕获 LLM 生成的输出中固有的复杂性和可变性。此外,这些指标通常依赖于明确的参考标准,将其使用主要限制在具有客观基准的领域。这项工作引入了一种新颖的评估框架,旨在对 LLM 生成的内容进行近似专家级评估。所提出的方法采用多个 LLM 的输出的成对比较,减少各个模型的偏差。 Elo 评级系统用于生成稳定且可解释的排名。可调节的协议阈值(从完全一致到多数投票)允许灵活控制评估置信度和覆盖范围。该方法的有效性通过评估从科学摘要中提取的能力概况来证明。初步结果表明,自动得出的排名与专家判断密切相关,显着减少了广泛的人工干预的需要。通过提供可扩展、一致且与领域无关的评估层,该框架支持跨不同应用程序对 LLM 输出进行更高效、更可靠的质量评估。