论文

HubRouter:混合序列模型的可插拔次二次复杂度路由

HubRouter: A Pluggable Sub-Quadratic Routing Primitive for Hybrid Sequence Models

模型架构Transformer

摘要

我们提出HubRouter,用可插拔的枢纽路由模块替代注意力层,将O(n²)复杂度降为O(nM),其中M远小于n,表示少量可学习枢纽词元。我们在从零训练的Jamba式混合架构和12层Transformer中演示该模块;将其直接接入预训练模型,是已测试的负面案例。流程包括编码、解码、评分与稀疏聚合:M个枢纽通过交叉注意力读取全部词元,词元相对枢纽投影形成路由指纹,评分头选出top-k词元,再仅对该子集进行稀疏聚合。三个设置验证如下。(1)Hub-Jamba的困惑度名义上改善4.2%(200.2对209.0,单种子,可能落在种子噪声范围内)。在序列长度1024、匹配的PyTorch原生基线下,训练吞吐最高约90倍;优化基线会将差距缩小至约10至15倍。(2)在匹配预算的扫描中,逐步替换25%的Transformer注意力层取得最低困惑度268.0,纯Transformer为282.4。(3)修复稀疏聚合的因果约束后,Hub-GPT在三个种子上达到211.5±0.4的困惑度,比Jamba的208.5±0.7差约3个单位,体现避免二次复杂度的质量代价。修复后块大小C影响很小;此前的块大小收益来自对抗检查发现的双向聚合信息泄漏。对M=1至32进行约105次多种子扫描,M=8至14可在五个种子中有四至五个可靠收敛;M=6加入正交正则化后达到五个全部收敛,M≥20则对种子更敏感。配套论文arXiv:2603.20997定义路由诊断任务,代码与脚本计划发布。