论文

构建 1 亿用户规模的客户支持 AI 代理:评估驱动的框架

Building Customer Support AI Agents at 100M-User Scale: An Evaluation-Driven Framework

模型评测评测方法与指标

摘要

LLM 功能的快速提升使得 AI 代理在广泛的任务中变得越来越可行。最有前途的应用之一是构建面向生产的面向客户的代理,这是一项挑战,需要在评估方法、上下文工程、训练和在线测量方面协调一致。然而,这些关键支柱通常是孤立开发的,造成的盲点只有在部署后才会浮现出来。在本文中,我们提出了一个统一的框架,为拥有 1 亿多用户的公司 Nubank 的客户支持人工智能代理连接离线开发和在线影响。我们的方法集成了几个关键组件:(1) 为客户支持代理量身定制的结构化上下文工程,(2) 系统的人机循环提示迭代,(3) 严格的 LLM 判断评估,并测量评估者间的一致性和 GEPA 优化以确保一致性,以及 (4) 构思到生产验证。一个核心观点是评估管道质量直接决定迭代速度。我们展示了跨越不同领域的五个生产部署的结果:卡交付、债务管理、信用额度支持、卡管理和产品解释。这些部署可带来一致的客户满意度收益,同时大幅加速迭代。在我们的发卡部署中,大规模 A/B 测试使 AI 交易净推荐值比之前的代理变体提高了 37 个百分点,自助服务率提高了 29 个百分点,同时离线模拟指标和在线结果之间存在很强的相关性,这表明评估驱动的开发可以可靠地预测生产影响。在大多数用例中,人工智能满意度仅比专家级人类代理低几个百分点。