论文
ConDA:从预训练扩散表示学习可辨识世界状态
Identifiable World Models from Pretrained Diffusion Representations
摘要
基于扩散的世界模型可以生成和预测高维动力系统中的轨迹,但预测准确性并不意味着它们的潜在坐标可以恢复潜在的状态变量或因果相互作用。我们询问冻结的预训练扩散模型是否可以配备可识别的坐标,而无需重新训练其生成 骨干模型。我们证明辅助变量非线性 ICA 保证可以转移到对比扩散对齐 (ConDA),它仅学习冻结扩散 潜变量 之上的轻量级对齐图。在标准 TCL/GCL 假设下,对齐表示识别潜在动态状态直至排列和分量可逆变换,保留潜在动态结构因果模型,并将滞后图恢复减少到转换 雅可比矩阵 稀疏性。我们针对物理和机器人视频系统中的 TDRL、CariNG、IDOL、temporal SuaVE 和 iVAE 评估基于 TCL、GCL 和 CEBRA 的 ConDA。 TCL 和 GCL 实现了近乎完美的块状状态恢复和具有竞争力的滞后图恢复,包括模拟落体系统中的精确恢复。在模拟双足机器人中,学习的动力学恢复了对 保留测试 控制扰动响应的符号和时间结构。这些结果表明,冻结的生成扩散模型可以配备可识别的、结构上可解释的坐标,并且可用于分析干预相关的动态。
