论文
LLM 冷启动评论推荐中汤普森采样的派生先验
LLM-Derived Priors for Thompson Sampling in Cold-Start Comment Recommendation
摘要
多臂老虎机算法,特别是汤普森采样,广泛应用于在线推荐中。尽管它们能够适应在线反馈,但当新引入的手臂很少或没有交互历史时,这些方法通常会受到冷启动的限制。在我们的设置中,候选臂是用户生成的文本评论,其语义内容可以在获得足够的交互反馈之前揭示标题的吸引力。因此,我们使用 大语言模型 (LLM) 从评论文本中提取语义信号,并将其转换为信息丰富的贝叶斯先验,在稀疏的早期反馈下热启动汤普森采样。为了考虑响应模式中总体分段级别的差异,我们分别维护和更新每个性别年龄分段的后验。在现实世界的在线 A/B/C 测试中,我们将统一先验与两种基于 LLM 的设计进行比较:用于人口亲和力线索的性别先验和用于特定标题身份线索的内容先验。结果表明,基于 LLM 的先验在稀疏反馈机制中最为有益——一旦积累了少量交互证据,就会出现最大的收益——并且先验设计会导致明显的漏斗级效应。我们进一步分析了优先奖励一致性和人口异质性,发现以点击为导向的一致性对于性别优先来说是最强的,并且不同人口群体的治疗效果差异很大。这些发现表明,LLM 派生的先验可以作为文本丰富的强盗推荐的实用热启动机制,同时也揭示了部署权衡。