论文

OmniVideo-R1:借助查询意图与模态注意力强化视听推理

OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention

模型训练预训练

摘要

尽管人类通过多种协同运作的模态感知世界,以支撑对周围环境的整体理解,现有的全模态视频模型在视听理解任务上仍面临重大挑战。本文提出 OmniVideo-R1,一个改进混合模态推理的新型强化框架。OmniVideo-R1 通过两项关键策略使模型能够“利用全模态线索进行思考”:(1)基于自监督学习范式的查询密集型定位(query-intensive grounding);(2)建立在对比学习范式之上的模态注意力融合。在多个基准上的大量实验表明,OmniVideo-R1 持续优于强基线,凸显了其有效性与稳健的泛化能力。

OmniVideo-R1:借助查询意图与模态注意力强化视听推理
图2:我们的OmniVideo-R1示意图。基于从数据准备中收集的数据集,我们的训练包含两个阶段:(1) QI阶段通过对齐多个时间-字幕对(无需过程级标注)来建立查询密集型的定位行为。(2) MA阶段通过优化对比模态奖励进一步执行模态注意融合。