论文
掩码扩散语言模型是面向智能体RL的强而可控的文本世界模型
Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL
摘要
强化学习(RL)的近期增长催生了对多样化、专用训练环境的需求。任务与奖励难度固定的手工环境会随模型性能提升而失效,长程稀疏奖励则会诱发对特定工作流或工具结构的模式坍缩。模拟环境状态的世界模型已能匹配纯真实滚动(rollout)的性能,成为按需扩展多样性的方向。但自回归(AR)世界模型受从左到右偏差制约,无法以全局相互依赖的状态锚点——如工具模式、先前回合与预期结果——为条件。我们(i)把文本世界建模形式化为可控的转移动力学问题,分解为初始状态、任务上下文、工具模式、领域规则与引导指令;(ii)整理了239,403条有真实依据的状态—动作轨迹,覆盖九个开源环境与十二个前沿模型家族。我们比较AR语言模型与掩码扩散语言模型(MDLM),显示MDLM凭借双向的锚点感知去噪,在相当推理延迟下取得比参数量4倍于己的LLM更好的连贯性、落地性与经实证验证的滚动多样性。我们提出即插即用的GRPO训练框架(含确定性状态检查),并在三个OOD环境(ScienceWorld、ALFWorld、AppWorld)上、跨三个1.2B–7B智能体底座(LFM2.5、Qwen3、Mistral)做零样本迁移消融:无需环境特定微调即取得最高47%的绝对增益。我们进一步对对抗场景下的失败模式做行为分析,并就真实性、结果正确性与训练效用做人类评估。工作已开源。