论文

SR-Agent:电商推荐后排序策略精炼的经验驱动智能体框架

SR-Agent: An Experience-Driven Agentic Framework for Post-Ranking Strategy Refinement in E-Commerce Recommendation

智能体系统Agent 架构与控制循环Agent HarnessAgent Skills

摘要

用户体验是工业电商推荐系统(RS)的一等目标。治理排序后列表的多样性、相似度与曝光的后排序策略,因简单且服务成本低而在工业RS中广泛部署。但随着在线推荐环境持续演化,这些静态配置的策略逐渐过时、损害用户体验;精炼它们通常依赖人工检查、诊断与更新,缓慢、昂贵且难以规模化复用。尽管近期的LLM智能体(如RecUserSim、SimUSER、Self-EvolveRec)提供了有前景的方向,但都没有闭合自动化、自进化策略精炼的完整回路。为弥合该差距,我们提出SR-Agent——据我们所知首个部署于工业RS精炼后排序策略的智能体框架。SR-Agent统一三个组件:(i)UserSim智能体应用检查技能暴露用户感知的坏案例;(ii)分析智能体把反复出现的坏案例整合为结构化、可复用的诊断;(iii)受约束的策略精炼治控把诊断映射为类型化、有界动作,由带可逆回滚的四阶段奖励管线门控。部署在快手电商平台后,SR-Agent持续运行该精炼回路:一个月的在线A/B测试中,订单量提升0.71%、浏览深度提升0.34%、点击类目多样性提升0.48%,同时显著缩短精炼周期、降低运营成本。

SR-Agent:电商推荐后排序策略精炼的经验驱动智能体框架:论文配图
图 1:动机和提议的 SR-Agent 框架概述。现有的排名后策略的维护依赖于静态配置、手动检查和延迟的指标反馈。我们的代理框架闭合了从不良案例发现和诊断到有界策略更新、离线验证和受控在线验证的循环。