论文
思维漏斗:通过提前投票与推演剪枝实现高效测试时扩展
Funnel of Thoughts: Efficient Test-Time Scaling via Early Voting and Rollout Pruning
摘要
大型推理模型对同一问题重复查询时会产生多样且有时不一致的答案,因此多样本推理是可靠部署的前提。k次推演的多数投票是该场景的标准解法和事实上的准确率目标,但在大型推理模型所需的规模上成本高昂。我们提出思维漏斗(Funnel of Thoughts, FoT),一种推理时方法,在保持完整32条轨迹投票准确率的同时将其注意力FLOPs减半,全模型推理成本降低28.8%。通过对六个大型推理模型的115K条推理轨迹的分析,我们发现低产轨迹常通过重复的犹豫标记(如“Wait”、“Actually”和“perhaps”)暴露自身。这些轨迹更不可能到达正确答案,并消耗不相称的注意力FLOPs,最坏情况下退化为无答案循环。基于这一免训练的词汇信号,FoT识别捕捉这些病态模式的词汇,并在完成前剪枝受影响轨迹,使在线生成注意力FLOPs减少56.1%、墙钟时间减少37.6%,且无需任何额外模型推理;同一信号无需重调即可迁移到held-out架构和域外任务。