论文
从假设驱动的错误分析自动生成高难度数学题
Automatically Generating Hard Math Problems from Hypothesis-Driven Error Analysis
摘要
已有大量数学基准用于评估LLM的数学能力。然而,其中大多数需要大量人工投入且难以扩展。因此,它们无法跟上LLM发展的步伐,也难以便捷地提供新题目以缓解过拟合。一些研究者提出了自动基准生成方法,但很少有方法专注于识别LLM易出错的特定数学概念与技能,且大多数只能生成特定类别的基准。为解决这些局限,我们提出新的数学基准生成流水线:利用AI生成的假设来识别LLM难以应对的特定数学概念与技能,然后针对这些弱点生成新的基准题目。实验表明,假设准确率与生成题目的难度正相关:由最准确假设生成的题目将Llama-3.3-70B-Instruct的准确率压低至最低45%,而其在原MATH基准上为77%。此外,该流水线具有高度适应性,可应用于数学之外的广泛LLM能力探索,使其成为研究LLM在不同领域表现的有价值工具。