论文

移动 NPU 上的节能设备端 RAG:Snapdragon X Elite 上的系统设计和基准测试

Energy-Efficient On-Device RAG on a Mobile NPU: System Design and Benchmark on Snapdragon X Elite

AI 基础设施模型部署

摘要

检索增强生成 (RAG) 管道属于计算密集型,结合了嵌入、检索、重新排序和 大语言模型 (LLM) 生成。完全在设备上运行它们有利于隐私、延迟和离线使用,但 CPU 推理的能源成本是一个主要障碍。据我们所知,我们展示了第一个在 Snapdragon X Elite 的 Qualcomm Hexagon NPU 上运行所有神经阶段(嵌入、重新排序和 LLM 生成)的端到端 RAG 管道。我们在 Dell XPS 13 笔记本电脑上进行分析,将 NPU 加速的 RAG 与 CPU 和 OpenCL/Adreno GPU 索引和查询工作负载的基准进行比较。在索引方面,NPU 的嵌入吞吐量提高了 9.1 倍,系统能耗降低了 12.3 倍。在 120 条查询的 Wikipedia-passage 基准测试中,与 CPU 基准相比,LLM 预填充速度提高了 18.1 倍,端到端查询延迟降低了 4.0 倍,系统能耗降低了 4.0 倍;集成 GPU 上相同的工作负载比 CPU 慢 1.7 倍,并且比 NPU 消耗更多能源 6.5 倍。 GPT-4.1 LLM-as-judge 评估发现 NPU 的答案质量与评估器噪声内的 CPU 和 GPU 相当(在 1-10 评分标准上分别为 9.32 vs. 8.95 vs. 9.03),86.7% 的查询在所有三个后端得分相同。在 Snapdragon X Elite / Hexagon 类笔记本电脑 SoC 上,NPU 能够实现实用、节能的设备上 RAG,且不会出现质量下降,这是一条通向绿色边缘智能的可持续道路,我们预计随着软件堆栈的成熟,将其推广到同类移动 NPU(Apple Neural Engine、Intel NPU、MediaTek APU)。