论文
超越准确性:统一多模式模型中的跨任务一致性基准测试
Beyond Accuracy: Benchmarking Cross-Task Consistency in Unified Multimodal Models
摘要
统一多模态模型 (uMM) 旨在支持共享表示中的视觉理解和视觉生成。然而,现有的评估协议独立评估这两种能力,并且不检查它们在语义上是否一致。因此,目前尚不清楚当前的 uMM 是否能够学习连贯的统一表示,从而在给定视觉概念的任务之间保持一致。我们引入了 XTC-Bench,一个基于场景图的评估框架,用于测量跨任务视觉语义一致性。通过从结构化场景图中导出生成提示和理解查询,我们的框架可以跨对象、属性和关系进行事实级对齐分析。我们提出了连续跨任务协议(CCTA),这是一种细粒度的指标,可以量化匹配原子事实的生成和理解之间的语义一致性,从而将内部一致性与独立任务的准确性隔离开来。对八个开源和一个商业统一模型的广泛实验表明,高生成或理解性能并不意味着强大的跨任务一致性,并且架构分析表明一致性取决于学习目标跨模态耦合的紧密程度,而不仅仅是架构统一。 XTC-Bench 提供了一个可重复且与模型无关的框架,用于诊断表示级偏差,为超越孤立任务性能的统一多模态建模提供了具体方向。