论文
通过错误定位调整测试时间
Test-Time Scaling via Error Localization
摘要
扩展推理时间计算已成为提高 大语言模型 在复杂推理和编程任务上的性能的可靠方法。然而,独立采样和顺序多轮细化等标准方法在没有 词元级 信用分配的情况下运行,导致计算效率低下,因为有效的推理前缀经常被丢弃。在这项工作中,我们引入了通过错误定位进行测试时间缩放(TTEL),这是一种推理时间算法,利用固定或环境反馈来执行 词元级 错误定位。通过将知情反馈下的条件概率与空上下文基线进行比较,TTEL 可以隔离发生错误的步骤。然后,该算法截断轨迹并分支新一代,最大限度地重用有效前缀。广泛的评估表明,TTEL 在顺序推理领域建立了严格的主导帕累托边界,通过传递 k 与生成词元成本来衡量。借助 LiveCodeBench 上的 Qwen3-8B,TTEL 的 pass@64 达到了 71.0%,同时生成的词元数量约为独立采样的一半(360.4k 与 735.0k)。推广到数学基准 AIME-2025 和 HMMT-2025,TTEL 在 Qwen3-8B 和 Qwen3-4B-Thinking-2507 上明显优于竞争测试时间基准。