论文
很难还是未达到?诊断数学推理难度估计中的采样盲点
Hard or Just Unreached? Diagnosing the Sampling Blind Spot in Math-Reasoning Difficulty Estimation
摘要
数学和科学推理基准依赖于 pass@k,即得到标准答案的采样链的分数,作为规范的每个示例难度信号。同样的信号通过可验证的奖励、数学数据管理、综合课程和验证者训练来驱动强化学习。我们证明这个代理在其最难的层上有一个持续的盲点:在我们测试的八个自由形式数学单元(四个开放权重模型中的 GSM8K 和 MATH)上,在六次尝试中没有采样种子解决的示例中,有 10.3-22.9% 是通过六链确定性机制在匹配计算中解决的。这些是贪婪解码加上通过激活嫁接应用的五个廉价残余流扰动,而单独贪婪在这些数学单元上最多解决 6%。恢复随着额外的预算而扩展,跨扰动,我们在所有 12 个单元格中验证了其机制的独特性(每个设置中的跨类固定集 Jaccard <= 0.47)。激活嫁接是作为对内部表征的干预,而不是解码方法;我们纯粹将其用作诊断和多样化工具,并且我们恢复的项目表明 pass@k= 0 % 层在残差流中在结构上是可识别的,而不是未修改的模型在普通推理下达到它们。