论文

表征推理时间 PRM 修剪片段嫁接惰性的配置:来自三个推理 LM 的证据

Characterizing a Configuration Where Inference-Time PRM-Pruned Fragment Grafting Is Inert: Evidence from Three Reasoning LMs

模型评测评测方法与指标

摘要

并行思想链中的多样性崩溃激发了基于自然设计的推理时间干预:当过程奖励模型(PRM)修剪一条链时,它的高 PRM 前缀被提取并逐字移植为上下文演示到仍在解码的同级中。我们将这种机制(PRM-修剪片段嫁接(PPFG))分离出来,作为跨轨迹步骤级转移的成本最低的操作化,并在之前的片段嫁接工作报告仅在额外补偿成分下获得增益的操作点上对其进行测试。在 Qwen2.5-7B-Instruct with Math-Shepherd 上完整的 MATH500(n=500,三个种子)上,停滞目标和随机目标变体中的 PPFG 在统计上与每个测量轴上的独立平行 CoT 基线无法区分。我们描述了原因:对 322 个停滞规则注入事件进行四桶分类显示,只有 14% 的目标是真正陷入困境的链条;其余的落在已经成功、接近完成或位于平坦的 PRM 高原上的链条上,救援移植物无法改变。没有复合门细化共同实现目标明确的发射和足够的密度,并且随机控制以 2.4 倍的发射速率匹配相同的奇偶性,因此惰性不是启发式特定的。这一发现在三个基本 LM、六个基准、第二个 PRM 和兼容性门扫描中得到了重复;双边测试分析促进所有 12 个 Qwen/LLaMA 细胞的奇偶性与阳性等价性。每个事件的抽查发现注入的链以匹配步骤速率的 2.75 倍进行修剪,但幸存的兄弟反事实发现没有群体水平的补偿。事后诸葛亮将选择 PPFG 而非独立的每个问题的收益限制在 +0.13 pp。我们贡献了一个等价测试模板,用于建立推理时间机制空值,每个声明的范围都限于其测试的操作点。