论文

渲染,而不是解码:具有潜在结构解缠结的权重空间世界模型

Render, Don't Decode: Weight-Space World Models with Latent Structural Disentanglement

模型架构新型架构

摘要

在大量未标记的视频上训练世界模型是迈向完全自主智能的关键一步。然而,将原始像素编码到不透明的潜在空间并依赖大量解码器进行重建的流行范例使得这些模型的计算成本昂贵且难以解释。我们通过引入 NOVA 来解决这个问题,NOVA 是一个世界建模框架,它将系统状态表示为基于辅助坐标的隐式神经表示(INR)的权重和偏差。这种结构化表示经过分析渲染,消除了解码器瓶颈,同时赋予紧凑性、可移植性和零样本超分辨率。此外,与大多数潜在动作模型一样,NOVA 可以通过动作匹配目标提炼为上下文相关的视频生成器。令人惊讶的是,在不诉诸辅助损失或对抗性目标的情况下,NOVA 可以解开背景、前景和帧间运动等结构场景组件,使用户能够编辑内容或动态,而不会影响另一个。我们在几个具有挑战性的数据集上验证了我们的框架,在单个消费级 GPU 上以 4000 万的参数运行时实现了强大的可控预测。最终,像 INR 这样的结构化表示不仅增强了我们对潜在动态的理解,而且还为沉浸式和可定制的虚拟体验铺平了道路。