论文

面向语音智能体评测的LLM裁判基准测试:可靠性、校准与人工监督

Benchmarking LLM Judges for Voice-Agent Evaluation: Reliability, Calibration, and Human Oversight

模型评测鲁棒性、公平性与可信度评测

摘要

大规模评测对话语音智能体需要可靠的评估方法,既能捕捉可观察的交互质量,又能体现通常由人类评估者提供的情境判断。我们研究LLM即裁判评测,将人类判断与GPT-4.1和GPT-5在电信和零售语音智能体对话上的表现进行对比,涵盖对话质量和安全维度。同样的交互在p0、p1、p2三种评测配置下打分,以检验自动化判断是否对评测设置敏感,以及观察到的模式是否能在不同配置和裁判模型间泛化。除总体一致性外,我们还考察指标层面的相关性、评估者一致性以及系统性的人机分歧,以识别哪些对话属性可以被自动化可靠判断,哪些仍依赖解释和上下文。有效的语音智能体评测还受流水线层面因素影响,如语音生成、流式处理以及ASR、推理和工具调用各阶段间的误差传播,这促使我们聚焦于比较人类与LLM裁判如何对同样的交互进行端到端打分。结果表明,基于LLM的评测可以作为大规模语音智能体评估的有效组成部分,但其可靠性依赖于指标和配置,并非一致可靠。这为识别哪些指标适合自动化评测提供了实证框架,并支持混合流水线:LLM裁判负责可规模化的评估,人类评估者继续负责需要情境解释和更高置信度判断的指标。

面向语音智能体评测的LLM裁判基准测试:可靠性、校准与人工监督:论文配图
图1:比较人类与LLM-as-Judge评估的工作流程,从语音智能体对话评分到分歧分析、校准与混合评估设计。