论文

ThinkRetrieve:面向测试时扩展的检索增强推理轨迹

ThinkRetrieve: Retrieval-Augmented Reasoning Traces for Test-Time Scaling

上下文与知识检索增强

摘要

大型推理模型(LRM)通过分配额外的推理时算力来生成延长的思维链推理以提升性能。然而,近期研究揭示,顺序式的测试时扩展常常收益递减甚至为负,因为更长的轨迹表现出更高的不确定性、误差累积以及偏离原始问题。我们提出ThinkRetrieve,一种测试时扩展框架,在LRM的每个推理步骤动态检索已解答示例来增强其推理轨迹。给定一个由问题及分步解答组成的外部语料库,ThinkRetrieve在每个中间步骤检索相关范例并直接注入思考轨迹,为模型提供关于“如何推理”的引导,而不仅是“哪些事实相关”。在GSM-8K、MATH-500、AIME 2025和SciQ上跨五个推理模型(1.5B–8B参数)的实验表明,ThinkRetrieve的准确率持续优于标准测试时扩展,在AIME 2025上相对提升最高达60%。

ThinkRetrieve:面向测试时扩展的检索增强推理轨迹:论文配图
图1:顺序测试时扩展(Muennighoff et al., 2025)与ThinkRetrieve的比较。(上) 在标准的顺序测试时扩展(Muennighoff et al., 2025)中,模型先生成一条初始推理轨迹,然后依赖自我反思(如“等等,让我们再想想”)来延长思考。然而,由于无法获得外部引导,后续推理常常偏离正确的解题路径,导致最终答案错误。(下) ThinkRetrieve用检索到的范例增强推理过程。在初始思考阶段之后,模型生成一个中间答案,并将其作为查询从外部范例库中检索相关的已解决示例。检索到的范例作为上下文示例(ICE)插入思考轨迹,使模型能够提取关键要点、识别自身推理中的错误,并在产出最终答案之前纠正方向。