论文
从数量到价值:设备上 RAG 的优先对齐记忆构造
From Volume to Value: Preference-Aligned Memory Construction for On-Device RAG
摘要
随着基于 大语言模型 (LLM) 的个人 AI 代理的快速出现,在设备上实现它们对于隐私和响应能力至关重要。为了处理现实世界请求固有的个人性和上下文相关性,此类代理必须将其生成基于设备驻留的个人上下文。然而,在内存预算紧张的情况下,核心瓶颈是存储什么,以便检索与用户保持一致。我们提出了 EPIC(高效的偏好一致索引构建),它将用户偏好作为个人背景的紧凑而稳定的形式,并将其集成到整个 RAG 管道中。 EPIC 有选择地保留原始数据中与偏好相关的信息,并使检索与偏好一致的上下文保持一致。在涵盖对话、辩论、解释和建议的四个基准测试中,EPIC 将索引内存减少了 2,404 倍,将偏好跟踪准确性提高了 18.79%p,并将检索延迟比最佳性能基准降低了 32.17 倍。在设备上实验中,EPIC 保持在 1 MB 以下内存,并在三个平台上实现了 5.21 至 29.35 毫秒/查询延迟,同时支持偏好漂移下的流式更新。我们的代码和数据可在 https://github.com/UbiquitousAILab/EPIC 获取。