论文
Qwen3.8-Omni:迈向原生全模式代理
Qwen3.8-Omni: Towards Native Omni-Modal Agents
摘要
我们推出了 Qwen3.8-Omni-Flash,这是一种用于现实世界多模式生产力的原生多模式代理模型。与之前主要强调感知和交互的全向模型相比,Qwen3.8-Omni-Flash 大幅提高了多模态理解和推理以及长视野代理任务的性能。这些功能由本机多模式协同训练策略支持,该策略保留强大的文本域功能,同时促进代理功能从文本到音频和视频任务的转移。该模型继承了Qwen3.8-Next的稀疏专家混合(MoE)架构,并将上下文窗口扩展到一百万个词元,支持长上下文多模态推理和长视野规划。这些进步使得能够作为主要代理或专门的子代理集成到制作工作流程中,支持视频编辑、长格式音频和视频翻译、音乐条件音乐视频或电影生成以及基于视频的音符或全技能创建。为了解决现有代理工具缺乏本机音频和视频支持的问题,我们发布了 Qwen-MM-Plugins,这是一个用于多模式生产力的轻量级开源插件框架。我们进一步将实时多模式交互构建为系统级挑战,需要协调上下文和内存管理、工具使用和子代理委托。因此,我们发布了 Qwen-Live-Harness,这是一个开源框架,用于基于 Qwen3.8-Omni-Flash 构建响应式实时多模式代理。广泛的评估表明,Qwen3.8-Omni-Flash 在多模式理解、推理、长视野代理执行和视频生产力任务方面实现了强大的性能。这些结果和随附的开源工具支持 Qwen3.8-Omni-Flash 作为在研究和生产中部署本机多模式代理的实用基础。