论文

跨模态共指对齐:在 Omni-LLM 中实现可靠的信息传输

Cross-Modal Coreference Alignment: Enabling Reliable Information Transfer in Omni-LLMs

模型评测基准与评测资源

摘要

Omni 大语言模型 (Omni-LLM) 在整体多模态感知方面表现出了令人印象深刻的能力,但在需要协同全模态推理的复杂场景中却始终表现不佳。除了理解全球多模态背景之外,有效的推理还取决于细粒度的跨模态对齐,特别是识别跨模态的共享指涉,但这方面在很大程度上被忽视了。为了弥补这一差距,我们将挑战形式化为跨模态共指问题,其中模型必须在源模态中定位所指对象,并在目标模态中重新识别它。在此范例的基础上,我们引入了 CrossOmni,这是一个包含九个任务的数据集,配备了人工设计的推理原理来评估和增强这种能力。对 13 个 Omni-LLM 的实验揭示了跨模态共指的系统性弱点,我们将其归因于缺乏共指感知思维模式。为了解决这个问题,我们通过两种策略来增强跨模式对齐:无需训练 上下文学习方法和基于训练的 SFT+GRPO 框架,旨在诱导这种思维模式。这两种方法都能带来显着的性能提升,并有效地推广到协作推理任务。总的来说,我们的研究结果强调跨模态共指是推进稳健的全模态推理的关键缺失部分。