论文
GRC:统一推理驱动的生成、检索和压缩
GRC: Unifying Reasoning-Driven Generation, Retrieval and Compression
摘要
目前,文本嵌入和生成任务通常基于 大语言模型 (LLM) 分别进行训练。这会导致大量的训练成本和部署工作。上下文压缩也是一项具有挑战性和紧迫性的任务,这对于推理驱动的生成以及需要长上下文和持续学习的代理任务至关重要。在本文中,我们探讨了如何在 LLM 的一次前向传递中统一推理驱动的生成、推理增强的文本表示和上下文压缩任务。通过元潜在词元和统一的生成、代表性和压缩调整方法,我们提出了一个名为 GRC 的训练框架,它连接了这三个任务。经过训练的模型可以在一次前向传递中实现三个目标,同时在推理过程中保持模块化、乐高式的灵活性。这种设计大大减少了检索增强生成(RAG)的部署工作量,并在训练期间实现了高效的推理和三倍的数据利用率。此外,该框架设计实现了文本嵌入的新范式:自推理潜在嵌入,以及新一代范式,潜在内存增强生成,其中长度为 O(1) 的压缩和内部化 KV 缓存用作可更新内存。我们还提出混合分页注意力来加速模型的推理。关于推理密集型检索基准、生成任务、文档压缩、延迟评估和 RAG 设置的大量实验证明了我们方法的有效性,并可能揭示真正统一的模型,该模型可以无缝处理推理驱动的生成、嵌入和压缩任务。