论文
大规模的程序性知识可以提高推理能力
Procedural Knowledge at Scale Improves Reasoning
摘要
测试时间缩放已成为改进具有挑战性的推理任务的语言模型的有效方法。然而,大多数现有方法孤立地处理每个问题,并且没有系统地重用先前推理轨迹中的知识。特别是,他们没有充分利用程序知识:如何重新构建问题、选择方法以及在需要时验证或回溯。我们引入了 \textbf{Reasoning Memory},这是一种用于推理模型的检索增强生成(RAG)框架,可大规模显式检索和重用程序知识。从现有的逐步推理轨迹语料库开始,我们将每个轨迹分解为独立的子问题-子例程对,产生包含 3200 万个紧凑程序知识条目的数据存储。在推理时,轻量级的思考提示让模型能够用语言表达核心子问题,在其推理轨迹中检索相关子例程,并在不同检索到的子例程下进行推理作为隐式程序先验。在六个数学、科学和编码基准中,推理记忆在文档、轨迹和模板知识以及计算匹配的测试时间缩放基线方面始终优于 RAG。凭借更高的推理预算(跨模型和任务的平均),它比无检索提高了 19.5%,比计算匹配基线提高了 8.9%。消融研究表明,这些收益来自两个关键因素:源轨迹的广泛程序覆盖以及我们的分解和检索设计,它们共同实现了程序知识的有效提取和重用。我们的实验代码可在 https://github.com/facebookresearch/reasoning-memory 获取。