论文
软提示的认知分块:通过分块因果掩码加速压缩器学习
Cognitive Chunking for Soft Prompts: Accelerating Compressor Learning via Block-wise Causal Masking
摘要
通过提示提供丰富上下文对发挥大型语言模型(LLM)的能力至关重要。然而,冗长上下文会显著增加推理延迟,因为自注意力的计算成本随序列长度呈二次增长。为缓解这一问题,上下文压缩——尤其是软提示压缩——已成为被广泛研究的解决方案,它通过训练好的压缩器将长上下文转换为更短的记忆嵌入。现有方法通常不加区分地将整个上下文压缩为一组记忆词元,这要求压缩器捕捉全局依赖,并需要大量预训练数据来学习有效模式。受人类工作记忆中的分块机制以及记忆嵌入相对原始词元空间特化的经验观察启发,我们提出并行化迭代压缩(Parallelized Iterative Compression,PIC)。PIC 仅通过修改 Transformer 的注意力掩码,便将记忆词元的感受野显式限制在顺序的局部块内,从而降低压缩器训练的难度。在多个下游任务上的实验表明,PIC 持续优于有竞争力的基线,其优势在高压缩场景中尤为明显(例如,在 64× 压缩率下,QA 任务的 F1 分数相对提升 29.8%,EM 分数相对提升 40.7%)。此外,PIC 显著加快了训练过程。具体而言,在训练 16× 压缩器时,它超越了有竞争力基线的峰值性能,同时有效减少约 40% 的训练时间。
