论文
Lance:通过多任务协同进行统一多模态建模
Lance: Unified Multimodal Modeling by Multi-Task Synergy
摘要
我们推出了 Lance,一个轻量级的原生统一模型,支持图像和视频的多模态理解、生成和编辑。 Lance 没有依赖模型容量扩展或文本图像主导的设计,而是通过协作多任务训练探索了统一多模态建模的实用范例。它基于两个核心原则:统一上下文建模和解耦能力路径。具体来说,Lance 从头开始训练,并在共享交错多模态序列上采用双流专家混合架构,实现联合上下文学习,同时解耦理解和生成的路径。我们进一步引入模态感知旋转位置编码,以减轻异构视觉标记之间的干扰并促进跨任务对齐。在训练过程中,Lance 采用了以能力为导向的目标和自适应数据调度的分阶段多任务训练范式,以增强语义理解和视觉生成性能。实验结果表明,Lance 在图像和视频生成方面大大优于现有的开源统一模型,同时保留了强大的多模态理解能力。主页位于 https://lance-project.github.io。