论文

评估现实对话环境中的语言模型

Evaluating Language Models in Realistic Conversational Contexts

模型评测基准与评测资源

摘要

随着 大语言模型 (LLM) 越来越多地被部署来服务开放式、多轮交互,评估人类规模的对话质量已成为一项核心挑战。为摘要、翻译或简短的 QA 任务构建的现有评估框架无法充分衡量人类规模对话的一致性,特别是当这些指标本身的推导和验证通常依赖于合成而不是人类来源时。我们通过引入 UPHELD(UPwork 人类规模评估长对话)来填补这一空白,这是一个大型的、参考资料齐全的基准,用于评估超越事实正确性的人类规模对话能力。 UPHELD 包含由专业剧本作家创作的数百个完整的人与人对话,具有逼真的回合密度和 30,000 多个专家生成的对话回合中每回合 36,000 多个人类注释。使用 UPHELD,我们系统地评估了经典的自动指标和无参考的 LLM 作为法官的方法,并发现它们在与专家的人类判断相关时不可靠。在此分析的基础上,我们使用 UPHELD 开发了一个 Mixture-of-Judges 框架,该框架结合了多个评估信号,并将与人类评估的相关性提高了约 30%。总体而言,UPHELD 为评估人类规模的对话智能提供了一个强大的、以人为本的基础,填补了现有 LLM 数据集领域的一个关键空白。