论文
A/B Agent:工业A/B测试中策略迭代的自演化Agent
A/B Agent: A Self-Evolving Agent for Strategy Iteration in Industrial A/B Testing
摘要
工业推荐策略迭代依赖于大规模的A/B实验。传统的调优需要专家反复设计策略、配置实验、分析结果和调整参数,使得过程劳动密集且时间消耗大。同时,历史实验中的宝贵知识往往碎片化,难以通过手动专家努力进行系统性复用。现有的RAG代理部分缓解了这一负担,但通常组织经验的方式是扁平化的,忽视了业务场景、推荐阶段、优化目标和实验环境之间的层级关系。这常常导致匹配度不一致且有限的跨场景迁移,而阻止代理通过连续的A/B反馈不断调整策略和参数。为解决这些问题,我们提出了一种闭环的A/B代理(A/B Agent),用于工业推荐策略优化。框架由三个紧密耦合的核心组件组成:历史策略知识组织、自主目标导向策略生成以及实验引导策略自我进化。它将历史策略组织成一个层级化的经验树,通过多路径的Tree-RAG检索可转移证据来生成可执行策略,并持续分析在线A/B反馈以指导自主调优和更新经验树进行自我进化。广泛的离线和在线评估展示了其有效性,包括在现实世界中的短视频电子商务推荐系统中,GMV提高了4.829%,同时所有护栏指标均保持正向增长。
