论文
用于高效深度缩放的通用 YOCO
Universal YOCO for Efficient Depth Scaling
摘要
测试时间缩放的兴起显着提高了 大语言模型 (LLM) 的推理和代理能力。然而,标准 Transformer 很难有效地扩展推理时间计算,因为传统的循环策略面临高计算开销和随模型深度膨胀的 KV 缓存。我们提出了通用 YOCO(YOCO-U),它将 YOCO 解码器-解码器架构与递归计算相结合,以实现比单独使用任何一种都更大的协同效应。 YOCO-U 基于 YOCO 框架构建,实现了通用自解码器,通过参数共享执行多次迭代,同时将迭代过程限制在浅层、高效的注意力层。这种组合产生了有利的能力-效率权衡,YOCO 和递归都无法独立实现。 YOCO架构提供了恒定的全局KV缓存和线性预填充,而部分递归以有限的开销增强了表示深度。 YOCO-U 共同提高了词元效用和扩展行为,同时保持高效推理。实证结果证实,YOCO-U 在通用和长上下文基准测试中仍然具有高度竞争力,表明高效注意力架构和递归计算的集成是可扩展 LLM 的一个有前途的方向。