论文
解对每一步仍不够:里程碑参照揭示LLM数学推理的组合缺口
Solving Every Step Is Not Enough: Milestone Oracles Reveal a Composition Gap in LLM Math Reasoning
摘要
大语言模型 (LLM) 可以自行解决多步骤数学问题的每个中间步骤,但仍然无法解决整个问题,即使给出了步骤的路线图及其所有答案。我们引入了 OracleLadder,这是一种诊断评估,通过为模型提供更高级别的 Oracle 帮助来定位 LLM 数学推理失败的位置。对于每个问题,教师模型都会编写中间子目标(里程碑)的固定路线图,并且确定性符号验证器会对每个答案进行评分。在没有帮助的情况下,使用路线图,使用路线图加上里程碑答案来测试模型,并且仅在每个里程碑上将每个失败分类为五个推理差距之一。在 354 个 NuminaMath 问题和从 8B 到 671B 参数的 6 个模型(Qwen3、gpt-oss、Llama 3.3、DeepSeek-V3.1)上,每个模型的最大差距是组合差距,这是组合差距的更严格形式。它涵盖了 33-48% 的问题,在删除 LLM 评审标记为评分错误的问题后,覆盖了 24-37% 的问题。准确性和里程碑帮助恢复对两个最强模型的排名不同,并且具有相似准确性增益的两个 RLVR 运行以不同方式解决问题。路线图效果在 MATH500 和 AIME 2024/25 上得到复制,在独立第二老师的指导下,每个问题的恢复对 83-87% 的问题一致,并且帮助阶梯延续到代码生成。我们在 https://github.com/slark-prime/OracleLadder. 发布数据、路线图、提示和代码