论文
OmniJigsaw:通过模态编排的重新排序增强全模态推理
OmniJigsaw: Enhancing Omni-Modal Reasoning via Modality-Orchestrated Reordering
摘要
为了将强化学习 后训练 范式扩展到全模态模型,以同时增强视频音频理解和协作推理,我们提出了 OmniJigsaw,这是一种基于时间重新排序代理任务构建的通用自监督框架。该范式以混洗的视听剪辑的时间顺序重建为中心,战略性地编排视觉和听觉信号,通过三种不同的策略强制跨模态集成:联合模态集成、样本级模态选择和剪辑级模态掩蔽。认识到此类代理任务的功效从根本上与拼图质量相关,我们设计了一个两阶段从粗到细的数据过滤管道,这有助于 OmniJigsaw 有效适应大量未注释的全模态数据。我们的分析揭示了联合模态集成中的“双模态捷径现象”,并表明细粒度的剪辑级模态掩蔽可以缓解这个问题,同时优于样本级模态选择。对 15 个基准的广泛评估表明,OmniJigsaw 在视频、音频和协作推理方面取得了巨大进步,验证了 OmniJigsaw 作为自监督全模态学习的可扩展范例。