论文

DIVE:扩展智能体任务合成的多样性以实现可泛化工具使用

DIVE: Scaling Diversity in Agentic Task Synthesis for Generalizable Tool Use

模型训练强化学习合成数据Agentic RL

摘要

近期工作为后训练工具使用LLM合成智能体任务,但在任务与工具集变化下的稳健泛化仍是开放挑战。我们把这种脆弱性追溯到合成任务多样性不足。扩展多样性之所以困难,在于训练要求任务保持可执行、可验证,而泛化又要求覆盖多样工具类型、工具集组合与异构工具使用模式。我们提出DIVE——一种证据驱动的配方,反转合成顺序:先执行多样的真实工具,再从所得轨迹严格反推任务,从而提供构造过程中的证据依据。DIVE沿两个可控轴扩展结构多样性(工具池覆盖与单任务工具集多样性),证据收集-任务推导循环进一步在五个领域373个工具上诱导出丰富的多步工具使用模式。在DIVE数据(48k SFT+3.2k RL)上训练Qwen3-8B,在9个OOD基准平均提升+22分,比最强8B基线高+68。值得注意的是,受控扩展分析显示:多样性扩展在OOD泛化上一致优于数量扩展,即使数据少4倍。

DIVE:扩展智能体任务合成的多样性以实现可泛化工具使用:论文配图
图 1:Dive 的动机和概述。上图:固定工具集综合和管道池限制了多样性并削弱了泛化能力。中:针对不同任务的模拟工具和查询优先综合增加了不可验证性/不可解决性风险,限制了代理训练。底部:Dive 对各种真实世界的工具进行证据优先的综合,生成可验证且可执行的任务。雷达:灰色:基础型号;蓝色:使用固定搜索/浏览工具集合成的深度研究数据进行训练(强分布但弱/负转移);紫色:使用匹配的数据和训练预算进行 Dive 训练(稳健概括)。