论文
AURA:大规模生产推荐系统的代理诊断和改进
AURA: Agentic Diagnosis and Refinement for Production Recommender Systems at Scale
摘要
推荐系统如何以及为什么会使其服务的用户失败?通常,从业者需要根据利益相关者团队的反馈、领域专业知识和数据分析的见解来改进他们的算法。然而,从总体定量指标中很难辨别推荐对最终用户的效果如何以及在何处表现良好或较差的细微差别。尽管这些指标提供了高层次且不完整的图片,但要进一步细化推荐的质量及其模式,需要通过领域理解和客观性进行大规模推理。我们考虑了这个复杂的难题,并描述了一种方法和实现,它使用最新的人工智能代理进步来为生产推荐系统提供可操作的诊断和改进。我们提出了 AURA(推荐算法的代理理解和细化),这是一种端到端代理系统,可以大规模执行定性评估,然后可以在代码级别对我们的算法进行改进。专业代理会读取生产参与日志(从数千个会话到数百万个会话),并显示推荐系统如何让真实用户失败的模式和示例。下一步使用这些诊断以及有关推荐者自己的代码、数据和训练管道的上下文来提出并实施基于该代码库的改进。我们报告了系统设计、对一家大型媒体流公司的两个大型消费者平台的生产数据的初步测试、保障措施、操作学习以及自我改进推荐系统的早期结果。最后,AURA 弥补的诊断差距并非特定于流媒体。该架构的构建是为了传输:每个特定于域的元素都通过配置层进入,该配置层已经在我们的两个平台之间移植了它。我们将其具体映射到电子商务和在线零售推荐。