论文
Paris 2.0:视频生成的去中心化扩散模型
Paris 2.0: A Decentralized Diffusion Model for Video Generation
摘要
我们推出了 Paris 2.0,这是第一个通过去中心化计算进行预训练的视频生成模型。其训练方法建立在 Paris 1.0 (arXiv:2510.03434) 的基础上,这是第一个开放权重分散扩散模型 (DDM),该模型表明可以在没有单片 GPU 集群的情况下训练图像生成。然而,时间相干的视频生成在去中心化训练中仍然是一个悬而未决的问题,而 Paris 2.0 解决了这个问题。在低分辨率文本到视频训练中,与在匹配的总计算预算下使用相同数据训练的整体模型相比,Paris 2.0 将 Frechet 视频距离 (FVD) 从 561.04 削减到 279.01,提高了约 2.0 倍,并提高了 CLIP 文本视频相似度和美观评分。