论文
DIVE:扩展智能体任务合成的多样性以实现可泛化工具使用
DIVE: Scaling Diversity in Agentic Task Synthesis for Generalizable Tool Use
摘要
近期工作为后训练工具使用LLM合成智能体任务,但在任务与工具集变化下的稳健泛化仍是开放挑战。我们把这种脆弱性追溯到合成任务多样性不足。扩展多样性之所以困难,在于训练要求任务保持可执行、可验证,而泛化又要求覆盖多样工具类型、工具集组合与异构工具使用模式。我们提出DIVE——一种证据驱动的配方,反转合成顺序:先执行多样的真实工具,再从所得轨迹严格反推任务,从而提供构造过程中的证据依据。DIVE沿两个可控轴扩展结构多样性(工具池覆盖与单任务工具集多样性),证据收集-任务推导循环进一步在五个领域373个工具上诱导出丰富的多步工具使用模式。在DIVE数据(48k SFT+3.2k RL)上训练Qwen3-8B,在9个OOD基准平均提升+22分,比最强8B基线高+68。值得注意的是,受控扩展分析显示:多样性扩展在OOD泛化上一致优于数量扩展,即使数据少4倍。
