论文

CogniRoute:学习在全模态模型中路由社会证据

CogniRoute: Learning to Route Social Evidence in Omni-Modal Models

摘要

全模态模型可以摄取视频、音频和文本,但对多种模态的统一访问并不能保证模型使用正确的证据。这种差距在社交视频问答中尤其明显,其中答案可能取决于手势、语气、时间线索或所说内容与视觉表达内容之间的不匹配。我们引入了 CogniRoute,一种用于社交全向推理的模式引导的专家混合框架。 CogniRoute 使用仅训练的认知模式,通过跨模态关系、推理需求和时间范围分解每个示例,并在监督 微调 期间将全局路由签名与此结构对齐。我们进一步引入了路径感知强化学习,它使用答案正确性、模态一致推理和认知时间定位的奖励来联合优化词元生成和专家分配。为了支持训练和评估,我们构建了 OmniSocialBench,这是一种诊断性社交视频 QA 资源,包含 118K 结构化训练示例、有证据依据的推理轨迹、模式标签、时间证据跨度和手动验证的评估分割。 CogniRoute 在 OmniSocialBench 上的平均准确率达到 59.38%,比最强的专有基准提高了 15.33 个百分点,比最强的开源全向基准提高了 26.77 个百分点,在需要视听协调、冲突解决和基于时间的社交推理的问题上进步最大。