论文

SmartRAG:移动设备上的原生图RAG

SmartRAG: Native Graph-Based RAG for Mobile Device

上下文与知识检索增强记忆Agent记忆

摘要

把大语言模型(LLM)部署为移动设备上的个人助理要求隐私、低延迟与离线可用,但巨型模型的计算成本与严苛的边缘硬件预算冲突。我们论证该张力无法仅靠模型压缩解决;它需要把端侧智能分解为互补的功能角色。我们提出SmartRAG:一个完全端侧的框架——围绕四个协调模块组织智能助理:感知、记忆、聚焦与思考。SmartRAG的核心是EvoNER:一个持续可学习的命名实体识别器——经教师蒸馏更新增量扩展其标签清单,使系统能吸收先前未见的实体类型而无需重训骨干LLM。抽取的知识存入MRGraph——一个三层、保留出处的知识图谱,查询时经结合图遍历、词法匹配与稠密语义检索的混合管线检索。端侧LLM仅被调用做高价值语义操作——标注、规划与答案合成——使推理成本有界。四个QA基准(TriviaQA、Natural Questions、HotpotQA、MultiHopQA)上的实验显示:配量化1.7B参数骨干的SmartRAG取得与最大18倍模型有竞争力的多跳推理表现,同时在实用内存与延迟包络内完全运行于普通智能手机。

SmartRAG:移动设备上的原生图RAG:论文配图
图 1:SmartRAG 架构概述。输入文本通过感知(EvoNER + 关系提取)流入内存(MRGraph),由焦点(混合检索)查询并由思考(LLM 驱动的规划和答案生成)消耗。虚线箭头表示异步后台进程(集群、增量训练)。