论文
GAUGE:在面向任务的代理的用户模拟评估中何时不信任大语言模型作为法官
GAUGE: When Not to Trust LLM-as-a-Judge in User-Simulated Evaluation of Task-Oriented Agents
摘要
比较和选择面向任务的LLM代理越来越依赖于低成本的离线评估门:角色驱动的LLM用户模拟器与每个候选人交谈,LLM作为法官对成绩单进行评分,得分较高的代理将获得晋升。我们引入了 GAUGE,一种可重复使用的离线协议,用于衡量该门的排名是否与来自 6 个提供商的 25 个代理在 $τ^2$ 基准和 SimulatorArena 基准上的可验证奖励相匹配,从而区分了发布实践中混合的两种评估有效性:排名有效性和构造有效性。首先,满意度与成功差距:满意度基本上不包含有关任务成功的信息,因为我们的盲人小组评定为满意的对话与实际成功无关,其中 57.5% 的客户任务失败,这一模式在五个评估者群体、两个基准以及我们评估的每个主观维度上都是一致的。其次,虽然门的排名在广泛的能力范围内是稳健的,但它在几乎相同的强代理中失去了分辨率:这种决策分歧率从广泛奖励对的 <1% 跃升至接近奖励对的 31%。因此,门是经过人工验证但锚定错误的。作为补救措施,我们提出了一种先校准后信任的节奏,其中无判断的完成位是截断回归的零成本绊线。