论文

文本为中心的全模态后训练

Text-Centric Post-Training for Omni-Modal Reasoning

模型训练监督微调与指令调优

摘要

改善全模态大语言模型的音视频联合推理通常伴随大量数据构建与训练成本。我们的诊断显示:尽管所有对应单跳问题都答对,多跳推理仍然困难,这提示感知与推理目标在局部优化中部分解耦。这促使我们对两种能力采用不同重点的后训练。仅文本推理训练在数据来源、模型规模与模型族间普遍带来增益。在最佳纯文本配置下,监督微调加强化学习使Qwen2.5-Omni-7B九项推理得分的几何均值比基座提升25.83%,优于完整的原生视听路线且节省56.6% GPU时。完全用纯文本LLM合成的数据训练再提升21.01%,构建与训练都不用视听数据。但纯文本训练会损害感知。因此我们提出以文本为中心的后训练范式:纯文本训练承担主要推理优化,随后减数据的原生视听RL修复感知。该修复比全量视听RL少用约90%输入词元,把感知恢复到基座之上,并保留最佳纯文本管道93.5%的推理增益。