论文
更好的插槽,更好的世界:以对象为中心的世界模型中的表示质量和鲁棒性
Better Slots, Better Worlds: Representation Quality & Robustness in Object-Centric World Models
摘要
从离线轨迹学习世界模型使智能体能够通过规划完成不同的任务。以对象为中心(OC)的表示将场景分解为一组绑定到其对象的槽,已被提议作为世界模型的归纳偏差,该模型具有更高的样本效率和更好的泛化能力。然而,之前的以对象为中心的世界模型 (OCWM) 将槽位编码器视为给定的,并且仅评估分布内的情况,而以对象为中心的偏差是否真正可用于规划以及 OCWM 内的驱动因素尚未确定。我们对 OCWM 进行了对照研究,以沿两个轴进行视觉模型预测控制:以对象为中心的表示质量和相对于以场景为中心的模型的分布偏移下的泛化。我们发现 (i) 规划成功与无监督时隙质量指标(FG-ARI、mBO)呈正相关,尽管收益在高时隙质量时饱和; (ii) 通过良好绑定的槽,先前方法所依赖的辅助本体感觉输入和掩蔽归纳偏差变得不必要; (iii) 在看不见的分布变化下,具有良好绑定槽的 OCWM 总体上比端到端训练的以场景为中心的 LeWM 更稳健,而基于类似的冻结预训练特征构建的 DINO-WM 仍然具有竞争力——表明预训练特征是鲁棒性的关键贡献者。