论文
快手-VL-2.0技术报告
Kwai Keye-VL-2.0 Technical Report
摘要
我们推出了 Kwai Keye-VL-2.0-30B-A3B,这是一种开源专家混合 (MoE) 多模态基础模型,旨在促进长视频理解和代理智能。为了解决小时级视频固有的超长上下文、信息冗余和计算成本过高的挑战,Keye-VL-2.0 率先将 DeepSeek 稀疏注意力 (DSA) 应用于基于 GQA 的多模态架构,实现无损 256K 上下文处理,同时捕获关键帧和长范围时间依赖性。该架构以高度优化的训练和推理基础设施为基础,包括可扩展视频 I/O、异构 ViT-LM 并行性和自定义 DSA 内核,可显着最大化吞吐量并最小化计算开销。此外,为了克服多任务对齐过程中灾难性遗忘的算法困境,我们引入了与 Context-RL 和 Video-RL 配对的 Cross-Modal Multi-Teacher 同策略 蒸馏 (MOPD)。通过将来自 同策略 部署的密集 词元级 教师反馈提炼回 MoE 主干(仅激活 3B 参数),Keye-VL-2.0 本身就可以通过多模式自我校正来支持跨代码、工具和搜索场景的高级代理协作。对视频理解、时间基础、推理、STEM 和智能体基准测试的广泛评估表明,Keye-VL-2.0-30B-A3B 在类似规模的模型中实现了最先进的性能,特别是在 TimeLens 上的细粒度时间定位以及 Video-MME-v2 和 LongVideoBench 上的长视频理解方面表现出色。我们发布模型检查点,以加速社区朝着可扩展且强大的多模式代理应用程序迈进。