论文
ThinkRetrieve:面向测试时扩展的检索增强推理轨迹
ThinkRetrieve: Retrieval-Augmented Reasoning Traces for Test-Time Scaling
摘要
大型推理模型(LRM)通过分配额外的推理时算力来生成延长的思维链推理以提升性能。然而,近期研究揭示,顺序式的测试时扩展常常收益递减甚至为负,因为更长的轨迹表现出更高的不确定性、误差累积以及偏离原始问题。我们提出ThinkRetrieve,一种测试时扩展框架,在LRM的每个推理步骤动态检索已解答示例来增强其推理轨迹。给定一个由问题及分步解答组成的外部语料库,ThinkRetrieve在每个中间步骤检索相关范例并直接注入思考轨迹,为模型提供关于“如何推理”的引导,而不仅是“哪些事实相关”。在GSM-8K、MATH-500、AIME 2025和SciQ上跨五个推理模型(1.5B–8B参数)的实验表明,ThinkRetrieve的准确率持续优于标准测试时扩展,在AIME 2025上相对提升最高达60%。
