论文

知道什么时候思考是不够的:教授小型推理模型进行超越其参数知识的推理

Knowing When Thinking Is Not Enough: Teaching Small Reasoning Models to Reason Beyond Their Parametric Knowledge

模型推理测试时计算扩展

摘要

扩展测试时计算是改进语言模型推理的有效方法,对于服务成本低廉的小型推理模型 (sRM) 特别有吸引力。然而,额外的思考总是正确的操作吗?通过对两个模型族和多个尺度的中间推理状态进行干预,我们发现自我精炼在很大程度上将概率质量巩固到从当前状态已经可达的解决方案上,而不是使新的解决方案可达到。这些干预措施揭示了两种故障机制:执行瓶颈(正确路径可达并且反射可以恢复它)和知识瓶颈(相关外部信息使其可达)。受这种区别的启发,我们引入了 FlyBy(一种选择性查询框架),并首先训练 4B 和 8B 变体进行推理,诊断尚未解决的问题,并在知识瓶颈处查询参数知识超出其自身范围的更强模型。有监督的微调引导多深度查询操作,成本感知强化学习校准是否查询、询问什么以及花费多少。在六个基准测试的 1,158 个难题上,FlyBy-4B 在 pass@8 上实现了 45.96% 的通过率,超过了 Qwen3-14B(41.64%),服务成本低了 2.7 倍,同时在 pass@1 上也超过了 Qwen3-8B(16.85% 对 15.31%)。扩展到 FlyBy-8B 进一步将 pass@8 提高到 51.81%。