论文
推荐反馈如何发展Agent记忆?
How Can Recommendation Feedback Evolve Agent Memory?
摘要
内容生成Agent不断接收来自推荐系统的印象、点击、转化和负面反馈,为记忆进化提供真实世界的结果信号。然而,这些信号存在延迟和噪声,受到受众构成、投放和推荐策略的干扰,并且可能是多个记忆的综合影响的结果,使得准确的归因变得困难。现有的方法主要依赖于即时反馈或语义检索,因此很难将推荐结果可靠地转化为记忆适应性。为了应对这一挑战,我们提出了 TIDE(Trajectory-Informed Directed Memory Evolution),这是一种由延迟推荐反馈驱动的外部记忆进化框架。我们进一步引入了记忆进化增益(MEG),它衡量了在严格的未来任务中,进化记忆相对于无记忆基线的效用改进。 TIDE 将记忆视为容量受限的经验群体:时间和语义信用分配估计上下文适合度,而责任信用根据生成过程中引用的记忆分配结果信号。然后,这些信号被用来强化、交叉、变异或驱逐记忆。在电子商务会员营销内容生成Agent上,TIDE 在离线时间重播中实现了 +7.75 个百分点的 MEG,并在在线 A/B 测试中显着提高了唯一点击率 (UCTR) 和激活率。在延迟标签基准测试中,TIDE 在比较方法中实现了最低的平均绝对误差 (MAE) 和均方根误差 (RMSE) 以及最高的 MEG,证明了其有效性。