论文

PyraMathBench:评估与改进大语言模型的数学能力

PyraMathBench: Evaluating and Improving Mathematical Capability in Large Language Models

模型评测基准与评测资源

摘要

尽管数值推理作为跨应用程序的大型语言模型 (LLM) 数学能力的基石发挥着关键作用,但很少有基准通过集成数值处理和数学推理来评估 LLM,从而阻碍了数学任务中失败的可解释性。我们推出 PyraMathBench,这是一个全面的分层基准,包含来自 7,404 个数学应用题的 32,505 个问题,涵盖 4 个关键认知方面、14 个子类别和 2 种模式。实验表明,大语言模型的表现因数值计算不足和抽象数值问题处理不力而受到严重影响。为了解决这个问题,我们提出了基于智能优化和学习的 VERsatile 模块(SOLVE)和交互式相对策略优化(IRPO),它们通过有效的工具调用(模糊匹配和低质量调用拒绝)增强大语言模型的数值数学协同作用。对比实验表明,Qwen-2.5 通过 SOLVE 和 IRPO 训练实现了 5.0 的分数提升。

PyraMathBench:评估与改进大语言模型的数学能力:论文配图
图 1:PyraMathBench 的分类以及将复杂推理问题(绿色和粉色)分解为子任务的两个示例,虚线代表多模态任务。