论文

ReRec:通过强化 微调 基于 LLM 的推理增强推荐助手

ReRec: Reasoning-Augmented LLM-based Recommendation Assistant via Reinforcement Fine-tuning

模型训练强化学习

摘要

随着 LLM 的兴起,人们对能够处理复杂查询并提供个性化、推理驱动的推荐的智能推荐助手的需求不断增加。基于 LLM 的推荐器在多步骤推理中显示出潜力,但面临挑战,强调了对推理增强系统的需求。为了解决这一差距,我们提出了 ReRec,这是一种新颖的强化 微调 (RFT) 框架,旨在改进复杂推荐任务中的 LLM 推理。我们的框架引入了三个关键组件:(1)双图增强奖励塑造,将 NDCG@K 等推荐指标与查询对齐和偏好对齐分数相集成,为 LLM 优化提供细粒度的奖励信号; (2) Reasoning-aware Advantage Estimation,将LLM输出分解为推理段,并惩罚不正确的步骤,以增强推荐的推理能力; (3)在线课程调度器,动态评估查询难度并组织训练课程,保证RFT期间的稳定学习。实验表明,ReRec 的性能优于最先进的基线,并保留了指令遵循和常识等核心能力。我们的代码可在 https://github.com/jiani-huang/ReRec 获取。