论文
SAGE:基于状态、考虑弃答的任务型对话智能体评估
SAGE: State-Grounded, Abstention-Aware Evaluation of Task-Oriented Dialogue Agents
摘要
评估面向任务的对话代理不仅需要判断回复是否读得好,还需要判断每一轮是否正确地推进底层工作流程状态——传统的整体LLM法官可能会错过这一区别,因为他们将可用的上下文作为一个单元进行评估,并且每轮都需要一个或多个完整模型调用。我们提出了 SAGE(基于状态的弃权意识评估),它将工作流程规范和每回合状态差异编译为原子的、基于模式的标准,并通过一系列符号和编码器/NLI 验证器进行路由,这些验证器弃权而不是猜测,将标准判决聚合为具有证据跟踪的回合级决策。其推荐的操作点 SAGE-Core 仅使用编译器、符号规则和设备上编码器即可决定 81--91% 的标准(LLM 成本为零),而 SAGE-LLM 为开放类标准添加了可选的聚焦 LLM 回退。在涵盖 MultiWOZ、模式引导对话和 ABCD 的四个切片中,没有评估 LLM 作为法官的基线(包括状态感知 GPT-4.1 法官和更便宜的 GPT-4.1-mini 变体)在任何切片上都显着超过 SAGE-Core,尽管 GPT-4.1 G-Eval 法官每 1,000 轮转向 SAGE-Core 的成本为 4.7--8.0 美元0 美元。两名注释者的人工审核(n = 200,$κ$ = 0.94)确认了转录可见失败类别的强标签保真度(其中,排除弱显着性 IUV 类别,SAGE-Core 在统计上与最强的 LLM 法官相关)并诚实地将被忽略的用户价值范围视为具有弱广泛人类显着性的状态一致性信号。我们分析注入失败和部分符号循环的构造有效性限制。
