论文

为什么推理模型会失去覆盖范围?数据和岔路口的作用

Why Do Reasoning Models Lose Coverage? The Role of Data and Forks in the Road

模型评测模型行为与机制分析

摘要

大语言模型 的最新进展导致了推理模型的出现,这些模型通过专门的 微调 程序在复杂任务上表现出了强大的性能。虽然这些方法可靠地提高了 pass@1 的准确度,但之前的工作已经观察到它们表现出覆盖范围缩小的行为,其中 pass@k 相对于基本模型而言性能下降。在本文中,我们研究了基于 SFT 的 后训练 下推理收缩的原因。我们假设这种行为是由 微调 数据的属性驱动的,特别是与决策点或“岔路口”场景相关,在这些场景中,模型遇到具有多个有效推理路径的难以解读的模式。为了检验这一假设,我们设计了模拟此类决策点设置的受控案例研究,跨越图分支和推理模式中难以理解的节点。通过跟踪这些设置中的 后训练 动态,我们发现收缩现象与训练数据中决策点场景的普遍性紧密相关。我们还证明,通过决策点的有针对性的数据合成设计和更系统的鼓励多样性的解码机制可以部分缓解这种收缩行为。我们的研究结果表明,以数据为中心的因素是推理模型萎缩的关键驱动因素,并强调多样性意识设计是控制它的有效杠杆。 (用于重现我们实验的数据和代码可在 https://github.com/psunlpgroup/reasoning_forks 获得)