论文
WorldAgen:通过测试时世界模型训练进行统一状态动作预测
WorldAgen: Unified State-Action Prediction with Test-Time World Model Training
摘要
视觉-语言-动作(VLA)模型如何适应世界动态变化的新环境?虽然最近的研究将世界建模和动作预测相结合来提高 VLA 性能,但现有方法很大程度上依赖于静态数据集的预训练,没有在部署时主动适应的机制。因此,当部署在具有新颖对象配置或动态的未见过的场景中时,这些模型通常无法泛化。我们提出了 WorldAgen,这是一个统一的框架,可以共同学习世界建模和动作预测,同时使测试时训练 (TTT) 能够适应新环境。 WorldAgen 采用具有两个头的共享 Transformer 主干:(1) 世界模型头,根据过去的状态动作轨迹预测未来状态;(2) 智能体模型头,根据任务指令预测动作。我们设计了一个混合单向注意力掩模来分离这两个模型。在测试期间,WorldAgen 对探索性动作进行采样,收集真实状态转换,并执行轻量级 TTT 更新以完善其世界模型。这种适应提高了模型对环境的理解,并导致更准确的动作预测。 CALVIN 和 LIBERO 基准表明,我们的基线模型实现了与当前最先进方法相当的性能,在某些情况下甚至更出色。此外,通过对少量样本进行 TTT,我们的方法超越了现有的最先进模型,凸显了在推理时调整世界模型的有效性。