论文
T-LoopFormer:基于令牌级弹性深度循环的Transformer用于动态路由的潜在推理
T-LoopFormer: Token-Level Elastic-Depth Looped Transformers for Latent Reasoning With Dynamic Routing
摘要
循环Transformer通过在多个迭代中复用共享参数,在推理和语言任务中表现出色,实现了参数效率而不牺牲表示能力。此外,循环Transformer直接在潜在空间中进行推理(潜在推理),减少推理过程中消耗的Token数量,从而提升样本效率。然而,现有模型通常对每个Token采用固定的递归深度,导致计算资源分配不均,未能充分发挥效率潜力。本文提出动态Token选择路由机制,使每个Token根据其隐藏状态自适应地决定递归迭代次数。通过动态路由器判断Token是否继续递归或提前退出,简单Token可绕过冗余计算,复杂Token则获得更深层次处理。为确保该自适应机制不损害解码效率,进一步引入递归级KV缓存,为每个递归循环维护独立的键值缓存。该设计确保不同深度的Token仅关注其对应的缓存状态,有效消除已退出Token的冗余计算,支持快速自回归解码。大量实验表明,T-LoopFormer在相同参数下,在PPL和10个零样本推理任务上均达到最新水平,甚至超过使用24倍 FLOPs 的基础模型,且推理延迟最低,验证了Token选择路由和递归级KV缓存的有效性。代码通过文中链接提供。
