论文

我们衡量的是策略还是措辞? LLM 数学推理中表面和方法层面多样性之间的差距

Are We Measuring Strategy or Phrasing? The Gap Between Surface- and Approach-Level Diversity in LLM Math Reasoning

模型评测评测方法与指标

摘要

LLM 数学推理中的多样性对于探索至关重要,但常见的多样性指标主要捕获表面水平的变化,而不是解决问题方式的差异。我们通过引入方法层面的多样性来解决这一差距:同一问题的正确解决方案之间的策略变化。使用人工校准的 LLM 判断框架,我们表明先前的多样性度量对于方法级多样性来说是不可靠的代理,并且这种不匹配会延续到多样性感知 RLVR,其中目标指标得以保留,而方法级多样性下降。研究方法级多样性何时有帮助以及是否可以直接诱导它,我们发现方法多样化的候选集可以改善测试时间的扩展。然而,在训练期间优化 LLM 法官多样性奖励会导致策略利用法官特定的偏好,而不是扩大其方法,从而使方法级别多样性的直接优化成为一个悬而未决的问题。我们的工作共同引入了接近级多样性的概念,并揭示了表面和接近级信号之间的系统差异,标志着朝着以真正多样化、类人方式进行推理的 LLM 迈出了一步。