论文

软提示的认知分块:通过分块因果掩码加速压缩器学习

Cognitive Chunking for Soft Prompts: Accelerating Compressor Learning via Block-wise Causal Masking

上下文与知识上下文工程

摘要

通过提示提供丰富上下文对发挥大型语言模型(LLM)的能力至关重要。然而,冗长上下文会显著增加推理延迟,因为自注意力的计算成本随序列长度呈二次增长。为缓解这一问题,上下文压缩——尤其是软提示压缩——已成为被广泛研究的解决方案,它通过训练好的压缩器将长上下文转换为更短的记忆嵌入。现有方法通常不加区分地将整个上下文压缩为一组记忆词元,这要求压缩器捕捉全局依赖,并需要大量预训练数据来学习有效模式。受人类工作记忆中的分块机制以及记忆嵌入相对原始词元空间特化的经验观察启发,我们提出并行化迭代压缩(Parallelized Iterative Compression,PIC)。PIC 仅通过修改 Transformer 的注意力掩码,便将记忆词元的感受野显式限制在顺序的局部块内,从而降低压缩器训练的难度。在多个下游任务上的实验表明,PIC 持续优于有竞争力的基线,其优势在高压缩场景中尤为明显(例如,在 64× 压缩率下,QA 任务的 F1 分数相对提升 29.8%,EM 分数相对提升 40.7%)。此外,PIC 显著加快了训练过程。具体而言,在训练 16× 压缩器时,它超越了有竞争力基线的峰值性能,同时有效减少约 40% 的训练时间。

软提示的认知分块:通过分块因果掩码加速压缩器学习
图4:不同压缩范式的比较。(a) 直接压缩(Direct Compression):每个记忆 token 在无结构约束的情况下对整个输入上下文进行全局注意。(b) 迭代压缩(Iterative Compression):受人类工作记忆中组块化机制的启发,我们将输入上下文切分为多个块,记忆 token 按顺序生成,每个 token 仅关注其对应的块和先前的记忆。(c) 并行化迭代压缩(Parallelized Iterative Compression, PIC):我们提出的方法允许所有记忆 token 在单个序列内并行处理,使用分块因果掩码来强制执行与迭代方法相同的局部依赖约束。