论文

太长;没解出

Too long; didn't solve

模型评测模型能力评测

摘要

由一系列数学题目构成的数学基准被广泛用于评估大语言模型的推理能力,但人们对基准的结构特性如何影响模型行为知之甚少。在本工作中,我们研究两个结构长度变量——提示长度与解答长度——并分析它们与新构建的、由专家撰写数学题组成的对抗性数据集上模型表现的关系。我们发现,在各个模型上,提示长度与解答长度都与模型失败率的上升呈正相关。我们还纳入了对跨模型分歧的次要探索性分析。在经难度调整的归一化分析中,两个变量与实际模型区分度仍保持弱负相关,其中提示长度的相关性略强。总体而言,我们的主要稳健结论是:在该数据集中,结构长度与经验难度相关联。

太长;没解出:论文配图
图1:按难度等级着色的题目数量,图中μ_i为每题在五个模型上的平均失败率,用于解题失败分析。