论文
超越注意力面具:指令锚定以实现高效的上下文扩散生成
Beyond Attention Masks: Instruction Anchoring for Efficient In-Context Diffusion Generation
摘要
上下文扩散 Transformer 将指令、目标和参考标记连接成单个序列以进行联合关注。因此,必须在每个去噪步骤中重复参考端计算,随着添加更多参考,成本会迅速增长。将引用词元与目标解耦可以跨降噪步骤实现精确的键值重用,但会阻止引用参与指令,从而降低指令跟踪和引用保真度。这种权衡不能仅通过注意力掩模设计来解决。我们引入了 AnchorCache,这是一种无参数标记布局和注意力掩码协同设计,可插入静态文本锚点。这些锚点在缓存构建期间调节指令上的引用表示,之后生成的引用键和值可以在去噪步骤中精确地重用。为了恢复通过这种结构转换最初损失的质量,我们应用教师强制速度 蒸馏,然后是一个简短的 同策略 阶段,该阶段在学生访问的状态下查询教师。据我们所知,这是首次使用 同策略 蒸馏 在扩散模型中进行架构恢复。在图像、语音和视频生成的基准测试中,AnchorCache 符合全注意力质量。其效率增益随着参考上下文大小的增加而增加,在扩散 Transformer 推理中达到 6.40 倍的加速。