论文

MidTool:面向Agentic工具使用的中间训练数据合成

MidTool: Mid-training Data Synthesis for Agentic Tool Use

模型训练智能体系统强化学习合成数据智能体互操作协议Agentic RLMCP

摘要

中间训练(mid-training)日益被认为是塑造大语言模型能力的关键阶段。近期工作表明,有针对性的中间训练可以强化数学、科学等推理密集型能力,也能提升软件工程场景中的Agentic能力。本工作研究与前者平行但探索较少的Agentic能力:通用工具使用。我们提出MidTool,一个面向Agentic工具使用中间训练的开放语料构建流程,它把大规模网页、PDF和代码数据与来自真实工具API、MCP技能以及基于文档的工作流的合成监督结合起来。MidTool旨在教模型识别工具可供性、依据上下文确定参数取值、编排工具调用工作流,以及在信息不完整时进行恢复。我们在MidTool-Mix上对Qwen3-4B-Base和Qwen3-8B-Base进行中间训练,随后进行包含监督微调与强化学习的后续后训练。与基线相比,MidTool-Mix在BFCL、tau2-Bench和MCP Universe上无论SFT还是RL都持续改善下游性能。这些结果表明,通用工具使用与其他重要LLM能力一样,受益于专门的中间训练,而不应完全交给后训练。

MidTool:面向Agentic工具使用的中间训练数据合成:论文配图
图1:左:MidTool-Mix是一个20.3B token的中期训练语料库,由网络、PDF、代码和工具来源构建,并包含合成的智能体轨迹。中:从基座模型开始的训练流程。右:在MCP-Universe上,我们中期训练的4B和8B模型优于Qwen3官方模型,表明专门的中期训练比单纯扩大规模能带来更强的智能体能力。