论文

享受您的演讲:以人为中心的多轮对话基准,具有解耦的用户模拟、目标建模和判断

Enjoy Your Talk: A Human-Centered Benchmark for Multi-Turn Dialogue with Decoupled User Simulation, Target Modeling, and Judging

模型评测基准与评测资源

摘要

将 大语言模型 (LLM) 评估为多轮对话伙伴需要单轮基准测试所缺少的探测功能:角色一致性、不断变化的意图跟踪、情绪动态和多轮目标完成情况。我们介绍 EYT-Bench,这是一个以人为中心的基准测试,其评估协议是围绕解耦的三方设计构建的:基于角色的用户模拟器、根据意图感知和响应生成评估的目标模型,以及独立的、可配置的 LLM 法官集合。在与 17 个目标模型的 3,400 次对话中,EYT-Bench 揭示了之前基准测试遗漏的四项发现:(i) 最先进的封闭模型和开源模型在主观维度上在统计上无法区分,但在客观意图跟踪方面相差高达 9 倍; (ii) 推理是对长上下文角色进行客观跟踪的一个阶段过渡,但在主观分数上基本持平; (iii) Persona 格式强烈影响轨迹传播,FICR(最终意图完成率)在 Nemotron-USA 上饱和于 0.95 以上,但在 PersonaMem-v2 上范围从 0.53 到 0.88; (iv) 17 个模型中有 16 个模型观察到了热身效应。