论文

Qwen3.5-Omni技术报告

Qwen3.5-Omni Technical Report

摘要

在这项工作中,我们展示了 Qwen3.5-Omni,它是 Qwen-Omni 型号系列的最新进展。 Qwen3.5-Omni 代表了对其前身的重大改进,可扩展到数千亿个参数并支持 256k 上下文长度。通过利用包含异构文本视觉对和超过 1 亿小时的视听内容的海量数据集,该模型展示了强大的全模态功能。 Qwen3.5-Omni-plus 在 215 个音频和视听理解、推理和交互子任务和基准测试中取得了 SOTA 成绩,在关键音频任务上超越了 Gemini-3.1 Pro,并在综合视听理解上与之匹配。在架构上,Qwen3.5-Omni 对 Thinker 和 Talker 都采用了 Hybrid Attention Mixture-of-Experts (MoE) 框架,从而实现高效的长序列推理。该模型促进了复杂的交互,支持超过 10 小时的音频理解和 400 秒的 720P 视频(1 FPS)。为了解决流语音合成中固有的不稳定性和不自然性(通常是由文本和语音标记器之间的编码效率差异引起的),我们引入了 ARIA。 ARIA 动态对齐文本和语音单元,显着增强会话语音的稳定性和韵律,同时将延迟影响降至最低。此外,Qwen3.5-Omni 扩展了语言边界,支持跨 10 种语言的多语言理解和语音生成,具有类似人类的情感细微差别。最后,Qwen3.5-Omni 展现了卓越的视听基础能力,可生成具有精确时间同步和自动场景分割的脚本级结构化描述。值得注意的是,我们观察到全模态模型中出现了一种新功能:根据视听指令直接执行编码,我们称之为视听氛围编程。