论文

M2A:在大语言模型中协同数学推理与智能体推理

M2A: Synergizing Mathematical and Agentic Reasoning in Large Language Models

模型优化模型训练强化学习模型合并Agentic RL

摘要

尽管推理已成为大语言模型(LLM)的核心能力,不同场景所需的推理模式却常常错位。数学推理通常依赖内在逻辑在单次回答中解决封闭世界问题,而智能体推理不仅需要内部推理,还需要与外部环境进行多轮交互、交替进行思考与行动。这种错位使数学推理与智能体推理难以相互有效受益,在多任务学习下常导致不稳定的推理行为和有限的性能提升。本文提出M2A,一种通过模型合并协同数学推理与智能体推理的新范式。为避免联合训练下对表面推理模式的过拟合,M2A直接在参数空间中操作:它识别对智能体行为至关重要的特征子空间,并仅沿其零空间合并数学推理任务向量,从而沿不扰动智能体行为的方向注入推理能力。与SFT或RL不同,M2A无需额外的梯度更新,并将合并系数暴露为控制推理长度的简单旋钮。在一个具有挑战性的真实代码智能体设定中的实验表明,我们的方法有效扩展了智能体推理深度并带来显著性能提升。应用于微调后的Qwen3-8B时,M2A在不重训模型的情况下将其SWE-Bench Verified解决率从44.0%提升至51.2%。代码可在https://github.com/laplucky/M2A.git获取。