论文

零标签 JEPA 驾驶世界模型中的地理多样性击败了跨域泛化的数据量

Geographic Diversity Beats Data Volume for Cross-Domain Generalization in Zero-Label JEPA Driving World Models

模型训练预训练

摘要

自监督的潜在世界模型可以在没有任何人类标签的情况下为驾驶场景分配令人惊讶的分数。一个自然的后续问题是,这样一个根据一个地理区域的驾驶数据进行训练的模型是否可以将其复杂性概念推广到看不见的城市和传感器配置。我们通过受控转移实验研究这个问题:我们在 nuPlan 数据(匹兹堡、波士顿、新加坡)上训练基于 JEPA 的世界模型,并在迈阿密和奥斯汀保留的 Argoverse 2 验证场景上评估零样本。我们发现,在不同地理位置的数据上训练的模型比在等量的单一地理数据上训练的模型具有更好的泛化能力。在每个条件 63,000 个场景(每个场景 n=3 个种子)的匹配规模消融中,相对于仅 nuPlan 训练,组合训练将平均意外得分降低了 16.5%(0.228 +/- 0.015 与 0.273 +/- 0.008)。值得注意的是,在 200,000 个仅 AV2 场景(来自一个地理位置的数据多出 3 倍)上进行训练仍然比组合 63K 模型产生更高的惊喜 (0.264),这表明地理多样性比原始数据量更能预测跨域泛化。