论文
抓住五分之一:LLM 作为法官在生产多轮交易代理中的盲点
Catching One in Five: LLM-as-Judge Blind Spots in Production Multi-Turn Transaction Agents
摘要
LLM-as-judge 是评估对话代理的默认工具,但其可靠性几乎总是被报告为与人类评分一致,而不是回忆出真正的缺陷。我们研究了一个部署的多轮食品和饮料订购代理,并使用 真值 进行详尽的人工转录审查,测量其内置 LLM 判断发现了多少真正的质量问题。在三个批次中,法官发现的系统问题远远低于人类确认的四分之一——一个批次中有 9 个模式中的 2 个(22%),而其操作门在人类确认了 23 个不同缺陷和 7 个新的横切模式的批次中的 100 个回合中标记了 0 个。我们的盲点分类显示失败是结构化的,而不是随机的:法官捕获了回合本地问题(捏造的统计数据、错误的语言),但错过了交叉回合状态问题(确认门锁定、购物车幻觉、升级锁定、过时的参照物)。机制:评分标准仅公开三个粗轴(意图、品牌声音、个性化),并且没有针对行为维度(状态跟踪、护栏、恢复)进行分类,而大多数缺陷集中在这些维度。失败在于路由,而不是感知:114 轮中的 113 轮,其原始法官笔记描述了确认门或购物车状态缺陷,被评分为“品牌声音”,并且没有一个达到操作故障 - 门被连接到挂起和硬断言,而不是标题 - 因此 0% 是路由和布线失败,而不是盲目。流行率估计的结果是尖锐的:当表观缺陷率为零时,Rogan-Gladen 校正退化——没有信号可以恢复真实率——而当门报告非零率时,相同的估计器意味着在我们测量的灵敏度下有 3-6 倍的低估。对于生产型多轮代理来说,自动判断是一个回归底线,不能替代人工审查。