论文

Intern-S2-Mobius:知识与推理解耦的基础模型

Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning

模型架构递归架构

摘要

我们提出Mobius-v0架构,它由一个存储知识向量的全局共享记忆模块(FFN)和多个迭代实现组合推理的Reasoner(Self-Attn)组成。以隐状态作为缓存和载体,Reasoner反复查询记忆以获取所需的知识向量,同时知识被传回推理算子。通过这种知识-推理分离架构,Mobius实现了更好的知识压缩和推理效率。基于Mobius-v0架构:1)我们从零训练的7B模型以基线62.6%的训练数据达到与7B Transformer基线相近的下游得分。2)我们的Intern-S2-Mobius由Qwen3.5-35B继续预训练而来,在下游得分相近的情况下实现近4倍的端到端推理加速。

Intern-S2-Mobius:知识与推理解耦的基础模型:论文配图
图6:两种训练方案下跨层的专家激活模式。左面板展示从零开始训练的 Mobius-7B;右面板展示通过架构转换与持续预训练得到的 Intern-S2-Mobius-35B。行表示专家 ID,列表示层索引,颜色表示选择频率的以 10 为底的对数。右面板中的专家 ID 经过重排,以揭示继承而来的路由结构。