论文
使用大型多模态模型的分层表示正则化来学习分类树
Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models
摘要
分类法提供了有关概念之间的语义关系以及视觉和语言的固有组织的关键信息。尽管其能力令人印象深刻,但大型多模态模型 (LMM) 往往缺乏分类知识,导致层次视觉识别 (HVR) 一致性较低。这些模型通常仅依赖于 微调 期间的语言建模目标,并且缺乏明确的分类感知正则化。为了解决这个问题,我们提出了层次表示正则化($HiR^2$),这是一种简单的即插即用正则化器,可以提高 LMM 中的层次一致性。具体来说,我们引入了一个语义感知的视觉树构建框架,该框架在文本提示的引导下从中间 LLM 层中提取从粗到细的视觉特征。正则化器结合了两个互补的目标:分类蕴涵损失,通过洛伦兹模型中的双曲蕴涵锥强制分层;判别性色散损失,促进单位球上语义相似嵌入的角度分离,而不干扰径向分层结构。大量实验表明,$HiR^2$ 可以有效捕获不同 LMM 和 微调 方法的分类结构。代码可在 https://github.com/PKU-ICST-MIPL/HiR2_ICML2026 获取。