论文
OneReason 技术报告
OneReason Technical Report
摘要
OneRec家族中的生成推荐模型已广泛应用于许多现实世界的服务中,例如短视频、直播、广告和电子商务。然而,这些生成模型只能受益于规模优势,而它们的推理能力很难激活,因为我们无法构建仅由项目标记组成的有意义的思想链(CoT)序列。受到 LLM 领域推理式“先思考后回答”范例成功的启发,我们进行了初步研究(即 OneRec-Think、OpenOneRec)来探索生成推荐中的推理能力。然而,我们注意到一个意想不到的现象:思维模式并没有表现出相对于非思维模式的优势。从多模态语言模型中 CoT 鲁棒性的最新研究结果中汲取见解,我们认为推荐中的有效推理取决于两个因素:感知(将项目标记扎根于其底层语言语义的能力)和认知(将用户的行为序列重新组织为连贯的潜在兴趣点的能力)。因此,我们提出了 OneReason,其中包括:(1)预训练 中强大的项目标记感知,(2)SFT 中推荐任务的三级认知增强 CoT 格式,以及(3)RL 中专门化然后统一的训练方法,以增强思维能力。