论文
FastE:用于 LLM 嵌入推理的读出触发Token压缩
FastE: Readout-Triggered Token Compression for LLM Embedding Inference
摘要
在本研究中,我们在最终读出的 LLM 嵌入模型中识别了深度相关的前缀冗余,特别是在包括 Qwen3-Embedding 和 Qwen3-VL-Embedding 在内的代表性骨干网中。我们发现,删除前缀状态在浅层中比在更深的层中更具破坏性,这表明随着前缀和读出状态在网络中传播,前缀状态变得越来越可压缩。为此,我们引入了FastE,一种免培训、即插即用的方法。 FastE 在批量均值读出前缀对齐上使用共享固定阈值作为轻量级在线启发式方法,用于选择何时进行压缩,并根据从读出位置接收到的注意力分数对前缀状态进行排名,以确定哪些状态保留在后续层中。我们的评估证明了 FastE 能够大幅降低计算成本:在采用 Qwen3-Embedding-0.6B 的 NarrativeQA 上,它将解码器主干 FLOP 减少了 40.11%,同时保留了 99.53% 的 Full Forward nDCG@10。在五个文本嵌入基准、两个主干尺度和三个跨模式检索任务中,质量效率权衡可以通过最大去除率直接定制,无需重新训练。我们相信 FastE 为检索、索引、聚类和多模态表示系统中的可扩展嵌入生成提供了实用价值。