论文

CORE:对比反思带来推理能力的快速提升

CORE: Contrastive Reflection Enables Rapid Improvements in Reasoning

摘要

语言模型可以使用可验证的奖励来改进各种推理任务。然而,参数化(例如 RLVR)和非参数(例如即时优化)方法通常都需要数百个训练样本和数千个模型部署,这使得它们在最好的情况下成本高昂,在最坏的情况下也很棘手。为了应对这一挑战,我们引入了对比反射(CORE),这是一种非参数学习算法,可以比较过去的推理轨迹来生成见解:推理策略和约束的简短自然语言描述,捕获成功和不成功的问题尝试之间的差异。在四个推理任务中,我们证明了 CORE 比参数(GRPO)和非参数(GEPA、情景 RAG 和 MemRL)方法能够实现更快的改进,同时使用更少的部署。在固定的部署预算和最少五个训练样本的情况下,我们表明 CORE 也实现了与每个基准相当或更高的性能增益。最后,我们强调 CORE 比非参数基线如何显着提高上下文效率,需要更少的提示标记,同时将学到的知识存储为紧凑的、可解释的自然语言见解。因此,我们的结果表明,将成功和不成功的推理轨迹之间的对比提炼为抽象和有用的见解,可以为模型自我改进提供比权重更新、提示优化或直接重用存储的推理轨迹更有效和可解释的途径。

CORE:对比反思带来推理能力的快速提升
图 1:CORE 算法说明:模型检索相关见解,然后生成推理轨迹和问题答案。如果模型没有正确回答,我们就会通过将失败的推理轨迹与模型正确回答的类似问题进行对比来产生新的见解。引导模型正确解决问题的见解被添加到内存存储中。