论文

带世界状态寄存器的流式多智能体自回归扩散模型

Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers

模型架构新型架构

摘要

多智能体交互世界模型不仅需要生成一致的观察,还应维护跨智能体共享、随视角变化而持续存在的世界状态。现有自回归视频扩散流水线以观察历史作为条件上下文,在多智能体和多视角场景中难以维护共享状态。论文提出流式多智能体视频扩散模型WorldWeaver(W^2),利用跨智能体世界状态寄存器增强连续视频生成:可学习词元保存共享世界信息、跟踪各智能体状态,并在每个视频片段生成后动态更新。 作者通过各智能体状态、包含鸟瞰视角的全局状态视图及场景文本等监督信号训练这些寄存器;进一步采用Mixture-of-Transformers设计,为世界状态建模与视觉帧建模使用不同权重。在双智能体Minecraft视频生成实验中,显式世界状态建模改善了逻辑一致性与生成质量。