论文
想得长,却很短:面向大推理模型的稳定序贯测试时扩展
Thinking Long, but Short: Stable Sequential Test-Time Scaling for Large Reasoning Models
摘要
序贯测试时扩展(sequential test-time scaling)是一种无需训练即可提升大型推理模型准确性的有前景方法,但按当前的实现方式,已观察到显著的局限。诱导模型进行更长时间的思考可以提升其准确性,但已有研究表明,随着推理长度进一步延长,也会导致准确性下降与模型不稳定。本工作提出一种新颖的序贯测试时扩展方法 Min-Seek,它在宽泛的诱导思考数量范围内显著提升模型准确性,稳定了序贯扩展的准确性,并消除了对推理长度微调的需要。除了在多种推理任务上提升模型准确性之外,我们的方法本身也是高效的,因为在推理过程中 KV 缓存中只保留一条额外诱导思考的 KV 对。借助一个存储不带位置嵌入的键的自定义 KV 缓存,并在每条新生成思考之前对其进行连续的动态编码,我们的方法可以在模型最大上下文长度之外继续良好推理,且在温和条件下具有线性计算复杂度。