论文
LASAR:用于生成推荐的潜在自适应语义对齐推理
LASAR: Latent Adaptive Semantic Aligned Reasoning for Generative Recommendation
摘要
大语言模型(LLM)在各种任务中通过思想链(CoT)展示了强大的推理能力,但逐个词元生成的低效率阻碍了延迟敏感推荐系统的实际部署。潜在推理已成为 LLM 中的有效范式,在连续的隐藏状态空间中执行多步推理,以较低的成本实现更强的推理。然而,这种范式在主流生成推荐中仍未得到充分探索。实现这一目标揭示了三个关键挑战:(1)无先验语义ID(SID)符号与连续潜在推理之间的差距,因为SID缺乏预先训练的语义,阻碍了联合优化; (2)由于缺乏推理链监督而导致表征漂移; (3)应用全局固定推理深度的次优性。为了解决这些问题,我们提出了 LASAR(潜在自适应语义对齐推理),这是一种 SFT-then-RL 框架。首先,我们通过两阶段训练弥补这一差距:第 1 阶段在第 2 阶段引入潜在推理之前基于 SID 语义,确保有效收敛。其次,我们通过显式 CoT 语义对齐来减轻表示漂移。逐步双向 KL 散度使用从 CoT 文本中提取的隐藏状态锚来约束潜在推理轨迹,而策略头则预测每个样本的推理深度。第三,在基于 GRPO 的 RL 阶段,仅终端 KL 对齐可容纳可变长度推理,并且 REINFORCE 优化策略头以动态分配步骤。这几乎使平均潜在步数减少了一半,同时提高了推荐质量。对三个真实世界数据集的实验表明,LASAR 在评估的设置中实现了最佳的整体性能。它增加了有限的推理延迟,并且比生成显式 CoT 文本快大约 20 倍。