论文
用于设备上检索增强生成的统一模型和文档表示
A Unified Model and Document Representation for On-Device Retrieval-Augmented Generation
摘要
传统的检索增强生成(RAG)方法通常假设检索和生成发生在远离最终用户的强大服务器上。虽然这减少了本地硬件限制,但它带来了显着的缺点:有关数据访问的隐私问题、经常性维护和存储成本、延迟增加以及互联网连接的必要性。设备上 RAG 通过在本地执行整个管道来解决这些挑战,使其成为查询财务文档、联系方式和病史等敏感个人信息的理想选择。然而,设备上部署需要在有限的内存和磁盘空间之间取得微妙的平衡。具体来说,必须限制提供给生成模型的上下文大小以管理 KV 缓存和注意力内存使用,同时必须最小化存储的嵌入的大小以保留磁盘空间。在这项工作中,我们提出了一个统一的模型,可以压缩 RAG 上下文并利用相同的表示进行检索。与使用单独的表示相比,这种方法最大限度地减少了磁盘利用率,同时显着减少了生成所需的上下文大小。与多向量检索模型相比,我们的模型平均具有 1/10 的上下文,可与传统 RAG 读取器的性能相匹配,而不会增加存储要求。这种方法代表了第一个使用共享模型和表示来统一检索和上下文压缩的模型。我们相信这项工作将激发不同模型的进一步整合,以优化设备上的性能。