论文
学习检测跨模态否定:潜表示分析与基于注意力的解法
Learning to Detect Cross-Modal Negation: An Analysis of Latent Representations and an Attention-Based Solution
摘要
跨模态检测否定这类高层语义概念对现有多模态系统仍是挑战。我们把它作为一个基本的表示学习问题分析,首次证明否定在标准视觉—语言模型(VLM)的潜空间中不构成线性或非线性可分的类别。我们证明预训练嵌入主要编码模态特定特征,缺乏可泛化的否定信号。为克服这一点,我们提出一个新的跨模态注意力架构,显式建模模态间依赖,相对单模态基线取得最高+7.03% F1的增益。分析揭示一个关键不对称:文本否定常独立出现,而视觉否定在语义上依赖语言上下文——这一发现经我们对3,222对政治视频—文本(经Qwen2.5-VL自动标注)的统计分析验证。结合该分析与自监督视频表示(JEPA2),我们推进了时序否定的建模。该工作为多模态系统中学习稳健、语义对齐的表示提供新方法与洞见。
