论文
MOSS-VL 技术报告
MOSS-VL Technical Report
摘要
我们推出 MOSS-VL,一个开放的视觉语言模型系列,它将实时交互(说话时感知)视为一流的功能。它是跨堆栈共同设计的:语言解码器仅通过门控交叉注意力来关注视觉,因此模型可以在生成时自然地看到传入的帧;合成的交互语料库监督何时说话、何时保持沉默以及何时修改;分阶段课程将所有实时特定训练集中在一个轻松的最后阶段,以强大的线下基础为基础。在线下,MOSS-VL-Instruct 在相当的规模上具有竞争力,并且在时间推理视频集上处于领先地位。在四个流媒体基准测试中,MOSS-VL-Realtime 在开源流媒体模型中的三个(第二个和第四个)中取得了最佳平均值,横扫了直接测试主动行为的三个子集 - OmniMMI 主动警报的最佳基准分别为 66.0 和 37.5。由于具有 11.3B 参数,但视觉标记位于解码序列之外,随着视觉上下文的增长,MOSS-VL 相对于相同骨干 Qwen3-VL-8B 的首个标记时间优势从 2.8 倍扩大到 5.1 倍。我们在 https://github.com/OpenMOSS/MOSS-VL 上发布了所有五个检查点、训练课程和实时推理代码。