论文

MagicAgent:迈向通用化智能体规划

MagicAgent: Towards Generalized Agent Planning

模型训练强化学习Agentic RL

摘要

大语言模型 (LLM) 从被动文本处理器到自主代理的演变已将规划确立为现代智能的核心组成部分。然而,实现广义规划仍然难以实现,这不仅是因为缺乏高质量的交互数据,还因为异构规划任务之间存在固有的冲突。这些挑战导致模型在孤立任务方面表现出色,但难以泛化,而现有的多任务训练尝试却受到梯度干扰。在本文中,我们提出了 \textbf{MagicAgent},这是一系列专门为广义智能体规划而设计的基础模型。我们引入了一个轻量级且可扩展的合成数据框架,该框架可以跨不同的规划任务生成高质量的轨迹,包括分层任务分解、工具增强规划、多约束调度、程序逻辑编排和长期工具执行。为了缓解训练冲突,我们提出了一种两阶段训练范式,包括监督微调,然后在静态数据集和动态环境上进行多目标强化学习。实证结果表明,MagicAgent-32B 和 MagicAgent-30B-A3B 具有卓越的性能,在 Worfbench 上实现了 $75.1\%$、在 NaturalPlan 上实现了 $55.9\%$、在 $\tau^2$-Bench 上实现了 $57.5\%$、在 BFCL-v3 上实现了 $86.9\%$、在 ACEBench 上实现了 $81.2\%$ 以及强健的准确度。我们内部 MagicEval 基准测试的结果。这些结果大大优于现有的 sub-100B 模型,甚至超过领先的闭源模型。

MagicAgent:迈向通用化智能体规划
图6:用于合成长时程工具执行轨迹数据的流水线。