论文

OmniReasoning:突破视听联合推理的极限

OmniReasoning: Pushing the Limits of Audio-Visual Joint Reasoning

摘要

最近的进展使得统一的全模态模型能够理解音频、视觉和语言。然而,现有的基准、训练数据和学习方法在很大程度上独立地对待这些模式,导致视听联合推理的能力评估不力且引出不足。我们通过基准、数据引擎和学习方法来解决这一差距。首先,我们介绍 OmniReasoningBench,这是一个音频和视觉证据缺一不可的基准测试。它包含 1,150 个多项选择题和开放式问题,涉及两项任务:视频推理和视频外推理。其次,我们开发了一个数据引擎OmniQA。它自动构建基于证据的问答对,明确需要视听联合推理,以及指导思维过程注释的带时间戳的线索链。除了我们的基准之外,该引擎还生成训练数据 OmniReasoning-SFT-112K 和 OmniReasoning-RL-19K。最后,我们提出了一种on-policy自蒸馏方法 Modality-Factored Self-Distillation (MFSD)。它在特定于模态的线索上下文下评估每个采样的响应,解开单个线索的贡献及其跨模态交互对词元级信用分配的影响。通过我们的训练数据和学习方法,我们的模型 OmniReasoning-30B-A3B 在 OmniVideoBench 上达到了 50.0%,在 OmniReasoningBench 上达到了 42.5%,分别将基础模型 Qwen3-Omni-30B-A3B-Thinking 提高了 12.8 和 9.3 个百分点。此外,它在一般和长视频基准测试(包括 Video-MME-v2)上取得了显着的进步。我们希望我们的工作为促进全模态联合推理的未来研究迈出坚实的一步。