论文
超越准确率:评估LLM数学推理的策略多样性
Beyond Accuracy: Evaluating Strategy Diversity in LLM Mathematical Reasoning
摘要
大语言模型现在在数学推理基准上实现了较高的最终答案准确性,但仅靠准确性并不能体现推理灵活性。我们引入了一个策略级评估框架,该框架在 80 个 AMC 10/12 和 AIME 问题上实例化,并具有 217 个 AoPS 派生的参考策略系列。使用双人工智能编码和人工判断,对模型输出进行策略一致性、有效性和正确性注释。在四个前沿模型中,我们发现答案准确性和策略多样性之间存在明显的脱钩。在单解决方案提示下,所有模型都实现了高精度(95%-100%),但在多策略提示下,它们恢复的策略比人类参考集要少得多。 Gemini、DeepSeek、GPT 和 Claude 分别生成 184、152、151 和 110 个不同的有效策略,其中在几何和数论方面差距最大。这些模型总共产生了 50 个基准新颖的有效策略,表明对人类策略的不完整覆盖和一定的替代推理能力。对 20 个问题的重复运行稳健性检查显示,发现的策略的收益正在递减,最强的模型在 3 次运行后仅恢复了 55 个 AoPS 参考策略中的 39 个(71%)。这些发现将策略多样性定位为评估答案正确性之外的数学推理的补充维度。
