论文

多媒体图灵模式:用于语言引导视频时刻检索的反应扩散多模态融合

Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval

模型架构新型架构

摘要

视频语言模型对于时刻检索和亮点检测等任务至关重要,但它们通常难以捕获时间视频序列和文本语义之间的动态非线性交互。现有的方法依赖于静态交叉注意力或提示调整机制,无法自适应地建模模态之间不断变化的关系,从而导致次优对齐和有限的泛化。受系统生物学的启发,我们提出了 \textbf{反应扩散多模态融合(RDMF)},这是一种新颖的框架,借鉴艾伦·图灵提出的模式形成原理,将视频语言对齐重新想象为反应扩散(RD)过程。在 RDMF 中,视频特征随时间扩散以捕获时间上下文,而文本-视频交互被建模为非线性反应,放大相关特征并抑制噪声,形成类似于生物系统的涌现模式。利用 Gray-Scott RD 模型,我们设计了一个计算高效的融合模块,该模块集成了视频和文本表示,并由使用图灵不稳定性标准对稳定性和收敛性进行严格数学分析的支持。我们的框架具有理论基础,采用先进的数学工具来确保稳定的模式形成,并且实际上是可行的,结合了预训练编码器和用于力矩检索和显着性预测的 DETR 式头等标准组件。 RDMF 代表了一种开创性的跨学科方法,它将系统生物学和多媒体研究联系起来,以解决传统多模态融合的局限性。初步实验证明了它在识别显着视频时刻方面优于现有方法的潜力,为视频语言任务提供了新的范例。