论文
Think2Go:使用 LLM 推理生成下一个 POI 推荐
Think2Go: Generative Next POI Recommendation with LLM Reasoning
摘要
下一个兴趣点(POI)推荐任务侧重于从历史签到中挖掘用户行为偏好模式,为下一个目的地提供个性化建议。现有方法主要依靠浅层上下文信息和手工特征交互来预测下一个 POI。然而,用户移动模式固有的稀疏性和复杂性限制了非推理模型捕获深层意图的计算能力,而 大语言模型 (LLM) 的表现并不理想,因为它们在单独训练 SID 时缺乏对语义 ID (SID) 的深入理解。为了解决这些限制,我们提出了 Think2Go,一种新颖的生成式下一个 POI 推荐框架,它增强了模型对 SID 表示的理解,并通过测试时计算缩放探索不同的时空模式。我们将有监督的 微调 (SFT) 和基于强化学习 (RL) 的推理统一在一个架构内,实现记忆和自适应推理的联合优化,以更好地保留用户行为模式,同时探索不同的用户偏好。为了进一步校准自适应推理中的策略优化,我们提出了两种优势加权机制,这些机制集成了(1)提示认知不确定性,通过核密度方法估计,以评估查询和用户历史之间的时空周期模式对齐,促进在高认知不确定性下增加探索; (2)基于奖励的优势缩放,通过根据最大值标准化奖励来适应更新幅度,从而提高训练稳定性并减轻对噪声信号的过度拟合。这种联合校准形成了隐式课程学习策略,提供细粒度、实例感知的策略更新,以防止熵崩溃并支持稳健的探索。