论文

AgenticQwen:使用双数据飞轮训练小型代理语言模型以供工业规模工具使用

AgenticQwen: Training Small Agentic Language Models with Dual Data Flywheels for Industrial-Scale Tool Use

模型训练强化学习

摘要

现代工业应用越来越需要充当代理的语言模型,能够在现实环境中进行多步推理和工具使用。这些任务通常是在严格的成本和延迟限制下执行的,这使得小型代理模型非常受欢迎。在本文中,我们介绍了 AgenticQwen 系列模型,通过对合成数据和有限数量的开源数据进行多轮强化学习 (RL) 进行训练。我们的训练框架将推理强化学习和代理强化学习与双数据飞轮相结合,自动生成越来越具有挑战性的任务。推理飞轮通过从错误中学习来增加任务难度,而代理飞轮将线性工作流程扩展为多分支行为树,更好地反映现实应用程序的决策复杂性。我们在公共基准和工业代理系统中验证 AgenticQwen。这些模型在多个代理基准上实现了强大的性能,并且在我们的工业代理系统中,在搜索和数据分析任务上缩小了与更大模型的差距。模型检查点和部分合成数据:https://huggingface.co/collections/alibaba-pai/agenticqwen。数据合成和RL训练代码:https://github.com/haruhi-sudo/data_synth_and_rl。数据合成管道也集成到 EasyDistill 中:https://github.com/modelscope/easydistill。