论文

DSReg:无需重构的世界潜变量分离

DSReg: Provably Recovering Individual World Latents without Reconstruction

模型评测模型架构模型训练新型架构预训练模型行为与机制分析

摘要

恢复世界的个体潜在变量的方法,从非线性 ICA 到字典学习和因果表示学习,通过重建、辅助监督或分布不对称(例如非高斯性)将潜在变量锚定到观察结果。没有这些锚点的方法,包括联合嵌入预测架构(JEPA),只能识别线性变换的潜在状态,因此各个潜在状态仍然是混合的。我们缩小了这一差距:可以证明,无需重建、无需解码器、无需标签即可恢复个体世界潜伏。关键条件是结构多样性:不同的潜伏在观察上留下了不同的依赖足迹,就像没有两片雪花是相似的一样。基于 LeJEPA 提供的线性可识别性,我们证明在结构多样性下,DSReg(依赖稀疏正则化)可以恢复个体世界潜伏直至有符号排列,而无需重建或解码器。它将事后应用于任何线性识别的表示,重用经过训练的检查点,不会造成联合损失 训练,并建立了第一个完全可识别的 JEPA,可以恢复每个潜在世界。此外,作为依赖足迹的条件,结构多样性严格弱于先前可识别潜变量模型的所有结构条件。在合成机制、世界模型探测、学习视觉编码器和外部渲染器中,DSReg 保留了密集预测,同时改善了个体潜在恢复和下游规模使用。

DSReg:无需重构的世界潜变量分离:论文原图
图 1:DSReg 将混合潜在状态转变为单独潜在状态。世界潜伏 zz 生成观测值 x=g⁡(z)x=g(z)。 LeJEPA 将潜在状态识别为线性变换 z^=Az\hat{z}=Az,因此每个学习变量都可以保持真实潜在状态的混合。 DSReg 恢复个体潜伏直到有符号排列。