论文
从理解到行动:基于反馈的生成推荐策略发现
From Understanding to Action: Feedback-Grounded Policy Discovery for Generative Recommendation
摘要
基于语义 ID 的生成推荐器可以实现高效的下一个项目生成,但其项目级监督主要捕获行为共现和局部转换。 大语言模型(LLM)可以通过推理异构交互历史来补充这些模型,以了解用户当前的需求。然而,LLM 本身并没有接受特定于推荐的结果反馈的训练,因此语言上合理的推理并不一定会导致有效的推荐决策。我们将这种不匹配称为理解与行动差距。因此,我们将捕获用户当前需求的意图知识与指定该需求下的推荐方向和拒绝边界的策略知识区分开来。为了弥补这一差距,我们提出了一种反馈驱动的代理框架,该框架首先诱导面向任务的意图,然后根据其在仅意图基线上的增量效用发现推荐策略。使用基于结果的反馈而不是语言的合理性来评估和完善候选政策。我们进一步通过双空间关系 蒸馏 将生成的意图和策略知识转移到轻量级语义 ID 生成器的两个潜在词元中,从而实现无 LLM 的在线推理。公共基准测试表明,与基线相比,实现了持续改进,而大规模在线 A/B 测试的收入增长了 4.506%,ADVV 增长了 4.621%。