论文
我们在多模态领域泛化方面取得进展吗?全面的基准研究
Are We Making Progress in Multimodal Domain Generalization? A Comprehensive Benchmark Study
摘要
尽管用于增强模型鲁棒性的多模态域泛化(MMDG)越来越受欢迎,但仍不清楚报告的性能增益是否反映了真正的算法进展,还是不一致的评估协议的产物。目前的研究是分散的,研究在数据集、模态配置和实验设置方面存在显着差异。此外,现有的基准主要关注动作识别,往往忽略了现实世界的关键挑战,例如输入损坏、模式缺失和模型可信度。标准化的缺乏阻碍了对该领域进展的可靠评估。为了解决这个问题,我们引入了 MMDG-Bench,这是第一个统一且全面的 MMDG 基准,它标准化了跨越三个不同任务的六个数据集的评估:动作识别、机械故障诊断和情感分析。 MMDG-Bench 包含六种模态组合、九种代表性方法和多种评估设置。除了标准准确性之外,它还系统地评估腐败鲁棒性、缺失模态泛化、错误分类检测和分布外检测。通过在 95 个独特的跨域任务中总共训练了 7, 402 个神经网络,MMDG-Bench 得出了五个关键发现:(1) 在公平比较下,最近的专门 MMDG 方法仅比 ERM 基线提供了微小的改进; (2) 没有任何一种方法能够在数据集或模态组合中始终优于其他方法; (3) 与上限绩效的巨大差距仍然存在,表明 MMDG 仍远未得到解决; (4) 三峰融合并不总是优于最强的双峰配置; (5)所有评估的方法在腐败和缺失模态场景下都表现出显着的退化,其中一些方法进一步损害了模型的可信度。