论文
EvoReason:自进化推理原语引导 同策略 蒸馏 用于生成推荐中的潜在推理
EvoReason: Self-Evolving Reasoning Primitive-Guided On-Policy Distillation for Latent Reasoning in Generative Recommendation
摘要
生成式推荐受益于推理增强推理,而潜在推理通过将中间推理过程编码为紧凑的连续表示以实现延迟敏感的部署,从而提供了一种有效的范例。尽管其效率很高,但现有的潜在推理方法通常依赖于直接将原始思想链(CoT)轨迹提炼为潜在表示,假设文本推理轨迹提供了足够的监督。然而,推荐推理轨迹包含具有冗余表达和不稳定推理路径的多种推理过程,使得原始 CoT 监督对于学习可转移的潜在推理表示来说不是最佳的。为了应对这一挑战,我们提出了 EvoReason,这是一种自我进化的潜在推理框架,它通过原始引导的 同策略 蒸馏 自适应地将显式推理监督与学生的潜在推理空间对齐。首先,EvoReason 从高质量的代理推荐轨迹中提取可重用的推理原语,其中每个原语捕获基本的推理行为,并充当结构化教师推理的伪工具。然后,基于这些原语,我们为教师配备了原语感知推理能力,使其能够生成结构化的 CoT 监督,减少冗余并提高一致性。最后,在潜在推理优化过程中,EvoReason 引入了一种自我进化的 同策略 蒸馏 机制,其中原语引导的推理过程根据学生的潜在推理结果而进化。通过这种闭环协同进化,策略更新不断改进潜在推理行为,并根据潜在推理结果进行细化,从而逐步实现更好的 CoT 监督和更有效的推理转移。