模型

LongCat-Next 发布并开源:DiNA 离散原生自回归架构统一视觉、语音与文本的原生多模态模型

美团发布原生多模态 LongCat-Next:当视觉和语音成为AI的母语

模型架构AI 基础设施模型评测应用与实践MoE新型架构模型部署模型能力评测语音交互与综合语音服务视觉感知与空间理解

概述

LongCat-Next 摒弃“语言基座+外挂视觉/语音模块”的拼凑式架构,采用 DiNA(Discrete Native Autoregressive)离散原生自回归架构:把图像、语音、文本统一映射为同源离散 Token,用同一个自回归骨干、同一套注意力与损失函数、纯粹的下一 Token 预测(NTP)范式建模,基座为 LongCat-Flash-Lite MoE(68.5B 总参数、3B 激活参数),训练中 MoE 路由逐渐出现模态专精化、激活专家数量相比纯语言设置增加。三项根本性改变:架构极简(多模态共享一套参数)、理解与生成对称(图像→文本为理解、文本→图像为生成,数学形式一致;消融中统一模型理解损失仅比纯理解模型高 0.006、生成损失比纯生成模型低 0.02)、模态内化(t-SNE 显示不同模态 Token 表征在表示空间自然融合,MoE 专家自发形成模态偏好分化)。配套的 dNaViT 离散视觉分词器具备:原生任意分辨率支持(不缩放、不裁剪、不填充,在 OmniDocBench、OCRBench 等密集文本场景表现优异)、8 层残差向量量化(RVQ)实现高达 28 倍像素空间压缩并由 DepthTransformer 合并重建、解耦双轨生成解码(结构像素解码器保布局 + 扩散像素细化器注纹理)以文本渲染无损;视觉 Token 只完成图像到离散 ID 的映射,真正的视觉表征在语言模型内部通过 embedding 原生学习。方法上提出语义完备性(Semantic Completeness)判据:以 SAE(Semantic-and-Aligned Encoder)这类大规模视觉-语言监督表征为基础,借残差传递把底层视觉细节持续传向高层,再用多级 RVQ 逐级拟合“残差中的残差”以在压缩率与保真间取平衡。指标:OmniDocBench 0.152 / 0.226(超越 Qwen3-Omni 与专用视觉模型 Qwen3-VL);LongText-Bench 英文 93.15;MathVista 83.1;MMLU-Pro 77.02、C-Eval 86.80;τ²-Bench 零售场景 73.68(对比 Qwen3-Next-80B-A3B-Instruct 57.3);SWE-Bench 43.0;音频侧 SeedTTS 中文与英文 WER 分别低至 1.90 与 1.89,MMAU 76.40、TUT2017 43.09,支持低延迟并行文本语音生成与可定制语音克隆。 团队把 LongCat-Next 模型与 dNaViT 分词器一并开源:GitHub https://github.com/meituan-longcat/LongCat-Next 提供代码仓库(技术报告 PDF 亦置于仓库内:https://github.com/meituan-longcat/LongCat-Next/blob/main/tech_report.pdf),HuggingFace https://huggingface.co/meituan-longcat/LongCat-Next 提供模型权重;同时上线可直接体验的 Demo https://longcat.chat/longcat-next 与介绍页 Blog https://longcat.chat/longcat-next/intro,开发者无需自行部署即可试用并基于开源产物做二次开发。