论文
OmniVideo-R1:借助查询意图与模态注意力强化视听推理
OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention
摘要
尽管人类通过多种协同运作的模态感知世界,以支撑对周围环境的整体理解,现有的全模态视频模型在视听理解任务上仍面临重大挑战。本文提出 OmniVideo-R1,一个改进混合模态推理的新型强化框架。OmniVideo-R1 通过两项关键策略使模型能够“利用全模态线索进行思考”:(1)基于自监督学习范式的查询密集型定位(query-intensive grounding);(2)建立在对比学习范式之上的模态注意力融合。在多个基准上的大量实验表明,OmniVideo-R1 持续优于强基线,凸显了其有效性与稳健的泛化能力。
