论文

扩展LLM推理

Expanding LLM Reasoning

模型推理测试时计算扩展

摘要

额外的推理计算通常用于采样更多的推理链。我们研究现有链内的额外延续应该从哪里开始。我们定义扩展效用,即在存储的步骤中重新启动链所带来的正确性变化,并在六个基准(41 个模型和基准单元)上的九个模型的每个合格步骤中对其进行测量。重新启动位置很重要:在 5、16 和 38 个单元的留出审核中,在一组连续上选择的步骤在对不相交的连续进行评分时胜过统一放置(在新的五单元审核中+4.25 分 [+2.51、+6.63])。从最后一个合格步骤(always-last)重新启动的固定规则是一个强大的基线:我们学习的路由器击败了统一放置,但没有显示出检测到的增益,并且在 DeepSeek-R1-Distill-Qwen-14B/MATH-500 上,always-last 在匹配的聚合生成输出处超过了精确的自一致性边界 +0.052 [+0.008, +0.098],使用 0.774x 的聚合生成输出四个样本自一致性。交叉拟合预言机选择仍然发现留出的空间超出了声明的位置类别,这是未来选择器的目标。最后,通过最早的索引打破步骤标签关系会翻转点选择器增益的符号,而不是在每步有四个执行轨迹的五种子诊断的每个种子中均匀放置;随机关系消除了偏见。