论文
思维轨迹上的 RAG 可以改善推理任务
RAG over Thinking Traces Can Improve Reasoning Tasks
摘要
事实证明,检索增强生成 (RAG) 对于知识密集型任务是有效的,但人们普遍认为,它对于数学和代码生成等推理密集型问题的作用有限。我们通过证明限制不在于 RAG 本身,而在于语料库的选择来挑战这一假设。我们建议不检索文档,而是检索思维痕迹,即在尝试解决问题期间产生的中间思维轨迹。我们证明思维痕迹已经是强大的检索源,并进一步引入 T3,一种离线方法,将其转换为结构化的、检索友好的表示,以提高可用性。使用这些跟踪作为语料库,简单的检索然后生成管道可以持续提高 AIME 2025--2026、LiveCodeBench 和 GPQA-Diamond 等强大模型和基准的推理性能,优于非 RAG 基线和标准 Web 语料库的检索。例如,在 AIME 2025-2026 上,具有 Gemini-2 思维生成轨迹的 RAG 对于 Gemini-2.5-Flash、GPT-OSS-120B 和 GPT-5 分别实现了 +56.3%、+8.6% 和 +7.6% 的相对增益,即使这些是较新的模型。总的来说,我们的结果表明,思维痕迹是推理任务的有效检索语料库,将它们转化为结构化、紧凑或诊断性表示可以释放更大的收益。代码可在 https://github.com/Narabzad/t3 获取。