论文
面向领域泛化的推理驱动多模态LLM
Reasoning-Driven Multimodal LLM for Domain Generalization
摘要
本文研究深度学习中的领域泛化(DG)问题。虽然多数DG方法专注于强制视觉特征不变性,我们利用多模态大语言模型(MLLM)的推理能力,探索构建推导图像类别的推理链,以在领域偏移下实现更稳健的预测。为此,我们使用DomainBed-Reasoning——一个新构建的DomainBed数据集扩展,其中每个样本都配有与类别相关的推理链——系统研究推理在DG中的作用。我们的分析揭示两个关键挑战:(i)用推理链微调MLLM做分类比直接标签监督更具挑战性,因为模型必须在类别预测之前优化复杂的推理序列;(ii)监督信号与微调MLLM之间推理模式的不匹配导致语义丰富性(信息量大但更难优化)与优化效率(更易优化但信息量小)之间的权衡。为解决这些问题,我们提出RD-MLDG(Reasoning-Driven Multimodal LLM for Domain Generalization),一个包含两个组件的框架:(i)MTCT(Multi-Task Cross-Training),引入额外的直接分类通路来引导推理监督;(ii)SARR(Self-Aligned Reasoning Regularization),在通过迭代自标注缓解推理模式不匹配的同时保留推理链的语义丰富性。在标准DomainBed数据集(PACS、VLCS、OfficeHome、TerraInc)上的实验表明,RD-MLDG取得最先进的性能,凸显推理作为稳健域外泛化的有前景补充信号。
