论文
SemPOI-RL:对齐 LLM 语义推理以实现可解释的外地 POI 顺序生成
SemPOI-RL: Aligning LLM Semantic Reasoning for Interpretable Out-of-Town POI Sequential Generation
摘要
大语言模型 (LLM) 表现出强大的语义推理和开放式生成能力,但将这些能力与结构化顺序生成保持一致仍然具有挑战性。这一挑战在外地 (OOT) POI 序列生成中尤为明显,其中模型必须从用户的家乡行为推断可转移的旅行意图,适应跨城市的兴趣漂移,并在结构约束下生成连贯的目的地轨迹。现有方法要么依赖于可解释性有限的基于潜在 ID 的传输,要么直接使用 LLM 进行序列生成,而没有将推断的语义明确地融入位置感知预测中。为了解决这一差距,我们提出了 SemPOI-RL,这是一个将 LLM 语义推理与结构化序列生成相结合的框架,以实现可解释的 OOT 推荐。具体来说,我们首先微调 LLM,使用自然语言作为可解释的语义中间体,从用户的家乡轨迹推断以目的地为导向的旅行方式。然后,我们引入语义 POI 对齐模块 (SPAM),将这些推断的样式转化为样式条件屏蔽自动编码器,以生成位置感知轨迹。最后,我们应用强化学习和面向推荐的奖励,使 LLM 生成的样式与下游序列质量保持一致。对两个真实世界数据集的实验表明,SemPOI-RL 始终优于传统推荐器和直接 LLM 基线,同时在旅行的不同阶段提供可解释的风格归因。代码可在 https://github.com/Wind-Flipped/SemPOI-RL 获取。