论文
LongCat-Next:将模态词汇化为离散标记
LongCat-Next: Lexicalizing Modalities as Discrete Tokens
摘要
流行的下一个词元预测 (NTP) 范式通过离散自回归建模推动了 大语言模型 的成功。然而,当代多模态系统仍然以语言为中心,通常将非语言模态视为外部附件,导致架构碎片化和集成欠佳。为了超越这一限制,我们引入了离散原生自回归(DiNA),这是一个统一的框架,它表示共享离散空间内的多模态信息,从而实现跨模态的一致且有原则的自回归建模。一项关键创新是离散本机任意分辨率视觉 Transformer (dNaViT),它以任意分辨率执行标记化和去标记化,将连续视觉信号转换为分层离散标记。在此基础上,我们开发了 LongCat-Next,这是一种原生多模态模型,可在单个自回归目标下以最少的模态特定设计处理文本、视觉和音频。作为一个工业强度的基础模型,它擅长在单一框架内观察、绘画和对话,在各种多模式基准测试中取得强劲的性能。特别是,LongCat-Next 解决了离散视觉建模在理解任务上长期存在的性能上限,并提供了一种统一的方法来有效协调理解和生成之间的冲突。作为对原生多模态的尝试,我们开源了 LongCat-Next 及其标记器,希望促进社区的进一步研究和开发。 GitHub:https://github.com/meituan-longcat/LongCat-Next