论文
SAGE:服务智能体图引导评估基准
SAGE: A Service Agent Graph-guided Evaluation Benchmark
摘要
大语言模型(Large Language Models, LLM)的发展推动了客服领域的自动化,然而对其性能进行基准测试仍然充满挑战。现有基准主要依赖静态范式与单维度指标,既未考虑多样的用户行为,也未考虑真实部署中所要求对结构化标准作业程序(Standard Operating Procedures, SOPs)的严格遵守。为弥合这一差距,我们提出SAGE(Service Agent Graph-guided Evaluation),一个用于自动化双轴评估的通用多智能体基准。SAGE将非结构化的SOP形式化为动态对话图,从而能够精确验证逻辑合规性并实现全面的路径覆盖。我们引入对抗性意图分类法(Adversarial Intent Taxonomy)与模块化扩展机制,实现跨领域的低成本部署,并促进自动化对话数据合成。评估通过一个框架进行:裁判智能体(Judge Agents)与规则引擎分析用户智能体与服务智能体之间的交互,以生成确定性的标准答案(ground truth)。对27个LLM在6个工业场景上的大量实验揭示出显著的“执行鸿沟”(Execution Gap):模型能准确分类意图,却无法推导出正确的后续动作。我们还观察到“共情韧性”(Empathy Resilience)现象:在高对抗强度下,模型尽管底层逻辑已然失败,仍维持着礼貌的对话表象。代码与资源可在 https://anonymous.4open.science/r/SAGE-Bench-4CD3/ 获取。
