论文

何时投票、何时重写:面向测试时扩展的分歧引导策略路由

When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling

模型推理测试时计算扩展

摘要

大推理模型(Large Reasoning Model,LRM)在数学推理任务上表现强劲,但在困难实例上仍不可靠。现有的测试时扩展方法,如重复采样、自我修正和树搜索,以增加计算为代价提升性能,但在困难问题上往往收益递减。我们观察到输出分歧与实例难度和预测正确性强相关,为在测试时引导实例级策略选择提供了有用信号。基于这一洞察,我们提出一个免训练框架,将测试时扩展形式化为实例级路由问题:不是在单一策略内分配更多计算,而是基于输出分歧在不同扩展策略之间动态选择。该框架对一致的情形采用轻量级处理,对中度分歧采用多数投票,对高度歧义的实例采用基于重写的重新表述。在七个数学基准和三个模型上的实验表明,与现有方法相比,我们的方法将准确率提升3%-7%,同时降低了采样成本。