论文

LatentOmni:通过统一视听潜在推理重新思考全模态理解

LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning

模型推理推理策略与问题分解

摘要

联合视听推理对于全模态理解至关重要,但当推理需要来自两种模态的细粒度证据时,当前的多模态 大语言模型 (MLLM) 仍然举步维艰。一个核心限制是,基于文本的显式思维链(CoT)将连续的视听信号压缩为离散的标记,削弱了时间基础并将中间推理转向语言先验。我们认为,统一的潜在空间是这种推理的更好媒介,因为它保留了密集的感官信息,同时与自回归生成保持兼容。基于这一见解,我们提出了 \textbf{LatentOmni},一种跨模式推理框架,它将文本推理与视听潜在状态交织在一起。 LatentOmni 引入了特征级监督,使潜在推理状态与任务相关的感官特征保持一致,并使用 Omni 同步位置嵌入 (OSPE) 来保持潜在音频和视觉状态之间的时间一致性。我们进一步构建了 \textbf{LatentOmni-Instruct-35K},一个用于监督潜在空间推理的视听交错推理轨迹数据集。跨多个视听推理基准的综合评估表明,LatentOmni 在评估的开源模型中实现了最佳性能,并且始终优于 Explicit Text CoT 基线,支持潜在空间联合推理作为实现更强全模态理解的有希望的途径。