论文
OmniEncoder:使用一个编码器像人类一样看到、听到和感觉到连续运动
OmniEncoder: See, Hear, and Feel Continuous Motion Like Humans With One Encoder
摘要
全模态 大语言模型 的最新进展使联合视觉音频理解取得了显着进展。然而,流行的架构依赖于具有 \emph{视频粗糙,音频密集}设计的特定模态编码器 - 以 1--2 fps 采样视觉帧,同时以 25 fps 处理音频波形 - 导致系统感知视频 \emph{逐帧,逐模态},而不是像人类那样整体感知。这种差异使得模型在编码过程中跨模式交互变得贫乏,并且无法捕获细粒度的视觉运动。为了弥补这一差距,我们提出了 \textbf{Omni-Encoder,这是一个统一的 Transformer 主干网络,旨在以对称的 25 fps} 在共享潜在空间中共同嵌入视觉和音频信号。该架构利用三项核心创新——Omni-Encoder Token Template、Omni-RoPE 和 Temporal Window Shifting——有效地解决模态解缠和计算效率的双重挑战。实验表明,与 LLM 解码器相同输入 词元预算 下的特定模态基线 Qwen2.5-Omni 相比,Omni-Encoder 在视觉连续理解任务(例如手语识别和细粒度体育动作分析)方面提供了显着的增益,同时在 AVQA 和说话人识别与定位等既定视听基准上保持了竞争性能。这些结果表明,统一的杂食编码为构建更能反映人类感知的综合性质的全模态模型提供了一个有前途的方向。