论文

Qwen-AgentWorld:用语言世界模型构建Agent训练环境

Qwen-AgentWorld: Language World Models for General Agents

模型训练模型评测强化学习基准与评测资源Agentic RL

摘要

Qwen-AgentWorld通过语言模型预测Agent采取动作后的环境变化,覆盖MCP、搜索、终端、软件工程、网页、操作系统与Android七类交互环境。训练使用真实环境轨迹,先进行持续预训练和监督微调,再用规则与评价标准混合奖励强化环境预测能力。 在Agent训练中,世界模型可以作为独立的环境模拟器,反复产生交互反馈,并控制环境扰动。论文比较模拟环境与真实环境训练,展示可控模拟对任务效果的改善;另一路径将世界模型训练作为Agent能力训练的准备阶段。AgentWorldBench以真实环境观察评价模拟质量,帮助区分环境预测能力与Agent自身的任务完成能力。

Qwen-AgentWorld原论文图1
原论文图1:语言世界模型的环境模拟与Agent训练路径。