论文
用于大型语言模型中高效潜在空间推理的动态语义压缩
Dynamic Semantic Compression for Efficient Latent-Space Inference in Large Language Models
摘要
大型语言模型 (LLM) 主要在词元级别执行推理,从而导致大量内存开销并降低计算效率。在本文中,我们提出了动态语义提取和推理(DSEI)框架,该框架通过两阶段训练策略在潜在空间内实现分段级推理。首先,我们通过自监督学习构建动态语义自动编码器(DSAE)。 DSAE 动态提取段级语义,并通过自适应语义加权和门控融合将其压缩为紧凑的潜在表示。随后,我们将 DSAE 集成到 LLM 架构中,并训练模型来推断密集的潜在空间。 DSEI 大幅减少了输入和生成序列,并显着提高了推理效率。在万卷数据集上进行的大量实验表明,与静态句子级潜在推理基线相比,DSEI 将困惑度降低了 48%。此外,与使用 token 级推理的标准 LLM 相比,DSEI 将推理速度提高了 2.5$\times$,并将内存开销降低了 90%。