论文
重构还是语义?是什么让潜在空间对机器人世界模型有用
Reconstruction or Semantics? What Makes a Latent Space Useful for Robotic World Models
摘要
基于世界模型的策略评估是通过在动作条件视频扩散模型中推出候选动作来测试现实世界机器人控制的实用代理。随着这些模型越来越多地采用潜在扩散模型(LDM),选择正确的潜在空间变得至关重要。虽然现状使用自动编码潜在空间(例如主要针对像素重建进行训练的 VAE),但最近的工作表明具有与表示对齐的语义潜在空间的预训练编码器的好处。我们通过比较六种重建和语义编码器来系统地评估动作条件 LDM 的这些潜在空间,以在 BridgeV2 数据集上的固定协议下训练世界模型变体,并在有和没有维度压缩的高维表示空间中显示有效的世界 模型训练。然后,我们提出三个轴来评估机器人世界模型的性能:视觉保真度、规划和下游政策性能以及潜在表示质量。我们的结果表明,仅靠视觉保真度不足以选择世界模型。虽然 VAE 和 Cosmos 等重建编码器实现了很强的像素级分数,但 V-JEPA 2.1(整体最强 同策略)、Web-DINO 和 SigLIP 2 等语义编码器通常在所有模型尺度的其他两个轴上都表现出色。我们的研究主张语义潜在空间作为与政策相关的机器人扩散世界模型的更坚实的基础。