论文

从日志到语言:学习生产中基于 LLM 的推荐的最佳语言化

From Logs to Language: Learning Optimal Verbalization for LLM-Based Recommendation in Production

模型训练上下文与知识强化学习上下文工程Agentic RL

摘要

大语言模型(LLM)是生成式推荐系统有前景的骨干,但一个关键挑战仍未被充分探索:言语化(verbalization),即将结构化的用户交互日志转换为有效的自然语言输入。现有方法依赖刚性模板,简单拼接字段,产生次优的推荐表征。我们提出一个以数据为中心的框架,为基于 LLM 的推荐学习言语化。借助强化学习,一个言语化智能体将原始交互历史转换为优化的文本上下文,并以推荐准确率作为训练信号。该智能体学会过滤噪声、纳入相关元数据并重组信息,以改进下游预测。在来自 Netflix 的大规模工业流式数据集上的实验表明,学习到的言语化使发现类物品推荐准确率相对模板基线提升最多 93%。进一步分析揭示了用户兴趣总结、噪声去除与语法规范化等涌现策略,为基于 LLM 的推荐系统的有效上下文构建提供了洞见。

从日志到语言:在工业规模上为基于 LLM 的推荐学习最优言语化
图1:数据中心推荐智能体(Data-Centric Recommendation Agent)的两阶段训练流水线。