论文

让智能体掌舵:基于影响力交换的闭环排序优化

Let the Agent Steer: Closed-Loop Ranking Optimization via Influence Exchange

智能体系统上下文与知识记忆Agent 架构与控制循环Agent记忆

摘要

推荐排序本质上是一个影响力分配问题:排序公式在相互竞争的因子之间分配排序影响力,业务结果取决于在它们之间找到最优的“汇率”。然而,离线代理指标会系统性地误判影响力的重新分配如何转化为线上效果,且各指标之间存在单一校准因子无法纠正的不对称偏差。我们提出Sortify,这是首个部署于大规模生产级推荐系统的全自主LLM驱动排序优化智能体。该智能体将排序优化重构为持续的影响力交换,在无人干预的情况下闭合从诊断到参数部署的完整闭环。它通过三个机制解决结构性问题:(1)基于Savage主观期望效用(SEU)的双通道框架,将离线-线上迁移校正(Belief通道)与约束惩罚调整(Preference通道)解耦;(2)在框架级参数而非低层搜索变量上运作的LLM元控制器;(3)拥有7张关系表、用于跨轮次学习的持久化记忆数据库(Memory DB)。其核心指标Influence Share提供了一种可分解的度量,所有因子贡献之和恰好为100%。Sortify已部署于两个市场。在A国,该智能体在7轮内将GMV从-3.6%推升至+9.2%,订单峰值达到+12.5%。在B国,一次冷启动部署在为期7天的A/B测试中实现+4.15%的GMV/UU与+3.58%的广告收入,并促成全面生产上线。

让智能体掌舵:基于影响力交换的闭环排序优化:论文配图
图1:三联总览:双通道架构图、多轮线上GMV与订单提升趋势、LLM修正收敛曲线。