论文
开放域定制视频生成的数据、模型与评测体系
A Comprehensive Ecosystem for Open-Domain Customized Video Generation
摘要
开放域定制视频生成缺少覆盖多样身份属性的大规模标注数据。研究提出PexelsCustom-1M,包含100万个身份、文本与视频三元组,覆盖8,000多个类别;并提出CustoMDiT,以仅8%的新增可训练参数,将预训练多模态扩散Transformer适配为定制视频生成器,效果优于此前方法。针对DreamBooth仅覆盖100类的局限,研究融合ImageNet与MS-COCO的跨数据集知识,构建覆盖1,000多个类别的OpenCustom基准。实验验证了数据与模型的优势。作者计划开源数据、流程、基准和实现。