论文

先模拟后上线:1.4亿规模生产级客户体验AI Agent的仿真筛选

Screen Before You Serve: Simulation for Production Customer Experience AI Agents at 140M Scale

智能体系统Agent任务评测

摘要

客户体验(CX)Agent利用工具和大语言模型来处理客户请求,并引导用户与组织产品之间的对话交互。改进这类Agent非常困难,尤其在受监管行业中:它们必须识别意图、遵循复杂的运营策略并可靠地使用工具。人工端到端测试覆盖有限,而线上实验则会让客户直接暴露于可能侵蚀信任的故障之中。我们提出一套假设驱动的仿真工作流,用于在部署前筛选候选CX Agent。合成客户对Agent的响应作出反应,模拟工具输出则使多步Agent工作流得以运行而无需调用生产后端。我们在Nubank的Card Delivery Agent及其扩展后继版本Card Management(Nubank在巴西对话量最高的聊天客服Agent)上使用Snowglobe仿真器。在4个已部署版本上,仿真与生产环境的版本级二分类评估分数高度相关。仿真引导的迭代在真实A/B测试中将交易净推荐值(tNPS)提升了36.69分。我们还在超过16,000段仿真对话中筛选了开源权重配置;在随后的真实A/B测试中,被选中的模型将自助服务率(SSR)提升8.82个百分点,达到Nubank观察到的最高水平,同时tNPS无统计显著变化。仿真使得对模型、推理设置和提示的大范围探索无需让客户承担风险即可进行,从而实现了仅靠线上实验难以企及的生产改进。

先模拟后上线:1.4亿规模生产级客户体验AI Agent的仿真筛选:论文配图
图 1:判断智能体改动是否可安全上线的三种方式。人工编写场景(A)只能覆盖有人想到要写下的场景;真实客户遇到的某些工具状态可能缺失。线上 A/B 测试(B)在生产环境中直接测量结果,但会让客户暴露在被测的智能体改动之下。同策略的工具边界仿真(C)以合成方式应答工具调用,让智能体依自身策略行动,从而在客户受影响之前暴露多轮故障。在生产环境中(D),经过筛查的智能体相对于匹配对照提升了自助率与交易 NPS。