论文
Unison:通过协同理解和生成对统一多模式模型进行基准测试
Unison: Benchmarking Unified Multimodal Models via Synergistic Understanding and Generation
摘要
能够理解和生成的统一多模态模型已经取得了显着的进步。然而,尽管设计统一,现有的评估通常单独评估理解和生成能力,忽视了理解和生成之间的协同作用。为了弥补这一差距,我们引入了 Unison,这是一个由 2,169 个高质量统一任务样本组成的综合基准,旨在评估统一多模态模型中的联合理解和生成。 Unison 提供三个关键优势: 1)综合维度:Unison 包含内部一致性、理解引导生成、生成引导理解以及相互增强以实现整体评估。 2)诊断评估:它提供了统一和解耦的理解和生成轨迹,允许对故障模式进行细粒度的归因并对统一建模的收益进行定量分析。 3)人类一致性:我们还引入了Unison-Judge,这是一种与人类判断非常一致的评估模型,以确保评估的可靠性。基于对 Unison 最先进模型的系统评估,我们发现了当前统一多模态系统的关键局限性,并强调了未来研究的有希望的方向。代码、Unison 和 Unison-Judge 可在 https://github.com/FudanCVL/Unison 上公开获取。