论文

Qwen-Planner-Agent:面向真实世界移动规划智能体的闭环AI-for-AI框架

Qwen-Planner-Agent: A Closed-Loop AI-for-AI Framework for Real-World Mobile Planner Agents

智能体系统模型训练强化学习Agent 架构与控制循环Agent HarnessAgentic RL

摘要

大型语言模型的快速进展正把AI从被动内容生成扩展到工程与科学发现的主动工作流。这一转变引出一个引人注目的问题:AI能否既是开发对象,又是构建下一代AI系统的积极参与者?我们在一个用于可扩展开发和迭代改进的闭环AI-for-AI框架内构建Qwen-Planner-Agent来探索这一问题。移动规划为这一方法提供了严苛检验:复杂的长程任务挑战智能体可靠性,而昂贵的真机交互限制开发可扩展性。该框架通过共享的动作-反馈-验证契约连接数据生产、模型训练和部署。(i)AI for Data构建人审把关的智能体数据飞轮,由专门智能体构建任务、收集交互轨迹、策划与平衡训练数据,并利用训练反馈指导后续数据生成。(ii)AI for Training将监督规划冷启动与混合环境在线智能体强化学习相结合,其中我们提出能力感知奖励与优势工程(CARE),在保持任务性能的同时降低推理与工具使用成本。(iii)AI驱动模型与harness的协同进化,通过执行证据驱动的循环在运行时编排记忆、技能和工具,并把结构化动作反馈和保留的失败轨迹回传给模型与harness的协同适配。Qwen-Planner-Agent在MobilePA-Bench上取得所有被评测模型和系统中的最佳整体性能,在工具使用、记忆、技能和子智能体协调上超越其基座模型。进一步评估显示我们的模型在非移动智能体基准上也有提升,同时大体保持通用能力。

Qwen-Planner-Agent:面向真实世界移动规划智能体的闭环AI-for-AI框架:论文配图
图 3:AI-for-Data 工作流。AI 辅助的任务构建为自动化交互收集与整理提供可执行任务。经核验的轨迹与可重置的任务分别支持面向规划的冷启动训练和在线 RL。AI 辅助分析 rollout 与开发集反馈,为下一轮迭代指导有针对性的任务生成与采样调整,每次数据发布前均经人工审查。蓝色实线箭头表示迭代内的自动化流程;橙色虚线箭头表示由人工把关的迭代间过渡。