论文
TorchUMM:面向评估、分析与后训练的统一多模态模型代码库
TorchUMM: A Unified Multimodal Model Codebase for Evaluation, Analysis, and Post-training
摘要
统一多模态模型(UMM)的近期进展催生了大量能够在视觉与文本模态间进行理解、生成和编辑的架构。然而,由于模型架构多样、训练范式与实现细节异构,为UMM构建统一框架仍具挑战。本文提出TorchUMM,首个支持跨多样化UMM骨干、任务与数据集进行全面评估、分析与后训练的统一代码库。TorchUMM支持覆盖广泛规模与设计范式的大量模型。其基准涵盖多模态理解、生成与编辑三个核心任务维度,并整合既有数据集与新颖数据集,以评估感知、推理、组合性与指令遵循能力。通过提供统一接口与标准化评估协议,TorchUMM实现了跨异构模型的公平、可复现比较,有助于更深入洞察各模型的优势与局限,推动更强大统一多模态系统的研发。代码见 https://github.com/AIFrontierLab/TorchUMM。
