论文

AVRT:通过单模态教师进行视听推理迁移

AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers

模型训练合成数据

摘要

推理模型的最新进展在基于文本的领域显示出显着的进展,但将这些功能转移到多模态设置(例如,允许对视听数据进行推理)仍然是一个挑战,部分原因是目标多模态组合中高质量推理数据的可用性有限。为了解决这个问题,我们引入了 AVRT,这是一种新颖的框架,可以从单模态教师模型生成高质量的视听推理轨迹。我们通过专门对各自模式进行推理的模型生成独立的视觉和音频推理轨迹,并将所得轨迹与 LLM 合并模型合并。生成的多模态轨迹用于监督 微调 (SFT) 冷启动,首先使目标模型适应视听推理轨迹,然后在大规模数据的第二个强化学习阶段对其进行训练。在七个视听和音频基准上进行评估,我们的 3B 和 7B 参数模型在同等大小的模型中取得了最先进的结果,包括用于视听推理的 OmniBench 和 DailyOmni 以及用于纯音频推理的 MMAR,这表明跨模态训练也可以转移到单模态任务,并为多模态推理模型建立新的训练管道。