论文

回顾:用于短视频推荐的反馈驱动的流语义用户配置文件

RECAP: Feedback-Driven Streaming Semantic User Profiles for Short-Video Recommendation

模型训练强化学习

摘要

基于语言的用户配置文件将长期行为历史转换为显式语义表示以进行推荐。然而,大多数配置文件生成器都是在开环中优化的:它们可以流畅地总结过去的行为,但没有直接接受训练来改进未来的推荐。我们在现实世界的短视频推荐中研究这个问题,其中用户行为随着流和配置文件必须在有限的容量下增量更新而不断到达。这需要维护一致的有界配置文件状态,并从工业隐式行为日志构建针对配置文件的语义反馈。我们提出了 RECAP,一个离线闭环框架,用于通过历史推荐反馈来优化流式结构化语义配置文件。 RECAP 通过将基于 LLM 的语义更新与确定性生命周期和容量控制相结合,将每个配置文件维护为有界结构化内存。 RECAP 通过使用 LLM 判断器过滤标签一致的行为对并训练双塔评估器(其匹配分数作为 GRPO 奖励)来构建以配置文件为目标的语义反馈。在快手短视频数据上的实验表明,RECAP比基础生成器将uAUC提高了0.0084,Recall@2000提高了约4.9%。进一步的分析证实了反馈构建和策略优化的好处,并在配置文件更新中显示出更扎实的细化和用户级抽象。为期 7 天的在线 A/B 测试进一步显示,每个用户的平均应用程序使用时间在统计上显着提高了 0.139%。