论文

大语言模型的数学迁移更多地遵循推理方法而不是主题

Mathematical Transfer in LLMs Follows Reasoning Approach More Than Topic

模型训练监督微调与指令调优

摘要

当为大语言模型选择数学训练数据时,一个自然的组织原则是主题:概率目标的概率示例。另一种方法是推理方法:即使数学领域不同,工作解决方案也与目标共享解决方案方法。我们询问哪种关系在微调后产生更大的转移。我们评估了两种平衡的 $2\times2$ 设计:概率和组合学与不变推理和重复计数交叉(2,000 个问题),数论和几何与补码和鸽子推理交叉(800 个问题)。在每个设计中,每个单元依次充当保留目标:相同方法(SA)源共享目标的方法但更改主题,而相同主题(ST)源共享主题但更改方法。每个源在每个角色中出现一次,因此加性源质量效应从等权总对比中抵消。在每个设计的五个基本模型和三个训练种子中,SA 在所有 40 个种子池模型目标比较中均优于 ST。初级设计中的模型级优势范围为 8.2 至 16.2 个百分点(平均值:10.8),第二个设计中的模型级优势范围为 12.0 至 16.0 个百分点(平均值:14.3);所有十个模型级 95% 置信区间均排除零。在这两种设计中,ST 源与嵌入和词汇测量下的目标更相似,因此 SA 优势与语句级相似性的测量顺序相反。这些发现将推理方法确定为比主题更有效的匹配标准,用于跨评估主题-方法组合的数学转移。