论文
基准测试:评估会话代理的基准
Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents
摘要
使用策划或自动生成的基准来评估面向任务的会话代理,但很少评估基准的质量。糟糕的基准可能包含不一致的任务、简单化的场景或有限的政策覆盖范围,从而导致评估不可靠。我们引入了一个无参考框架,该框架使用 LLM 判断器来评估基准一致性、复杂性和政策覆盖范围,同时提供可操作的弱点诊断。我们通过证明与独立人类注释的一致性以及评估由不同功能的 LLM 生成的基准以及受到受控质量降低扰动的基准来验证该框架。跨领域和判断模型,所提出的指标始终区分基准质量水平。我们进一步证明了该框架对手动策划的基准的适用性。我们的框架提供了一种实用的方法来评估合成的和手动策划的对话代理基准。