论文
Taiji:工业 LLM 增强推荐的帕累托最优策略优化与语义 ID 权衡
Taiji: Pareto Optimal Policy Optimization with Semantics-IDs Trade-off for Industrial LLM-Enhanced Recommendation
摘要
通过 大语言模型 (LLM) 扩展推荐系统已成为行业的一个突出趋势。然而,通过 后训练(例如,SFT 和 RL)将 LLM 的语义空间与推荐者的 ID 空间对齐仍然具有挑战性。现有的LLM4Rec范式受到两个主要问题的瓶颈:(1)在SFT期间测量和提高开放域推荐的思想链(CoT)质量的困难,以及(2)在RL对齐期间忽略LLM语义奖励和推荐偏好奖励之间的权衡。受这些挑战的启发,我们推出了 Taiji,这是一种专为工业推荐系统设计的新型 LLM-as-Enhancer 框架。为了克服 SFT 瓶颈,我们利用逆向工程推理和开放式拒绝采样来生成高质量、特定领域的 CoT 数据。为了解决 RL 对齐问题,我们提出了帕累托最优策略优化(POPO),它自适应地调整跨域奖励权重。理论上,它实现了LLM的语义世界知识和代表在线用户偏好的协作ID特征之间的最佳权衡。广泛的离线评估和在线A/B测试验证了太极的有效性。太极自 2026 年 5 月起部署在快手的广告平台上,目前每天为超过 4 亿用户提供服务,产生了可观的商业收入,并在网络规模环境中展示了其强大的可扩展性。