论文

使用 LoRA 适配在技术文档 RAG 助手中分析质量-延迟-资源权衡

Analyzing Quality-Latency-Resource Trade-offs in a Technical Documentation RAG Assistant Using LoRA Adaptation

模型训练参数高效训练

摘要

我们研究基于文档的检索增强生成(RAG)系统中的质量-延迟-资源权衡,该系统使用生成器的低秩适应(LoRA)。我们根据官方 Kubernetes 文档构建了 5,144 个问答对的手动验证基准,并将其与固定的混合检索管道(BGE-M3 密集、BGE-M3 原生稀疏、倒数排名融合、交叉编码器重新排名)相结合。在此基准测试中,我们在 Llama-3.2-3B-Instruct 和 Llama-3.1-8B-Instruct 上跨等级和目标模块选择消除了 20 个 LoRA 配置,并在 词元级 F1、LLM 判断的基础性和正确性 (pass@4)、推理延迟、推理内存和训练成本上评估每个配置,所有报告均以引导程序 95% 置信度报告间隔。 Pareto 分析表明,仅作用于 q 和 v 注意力投影的 LoRA 适配器始终占据主导地位,而 3B/8B 选择主要定义操作机制。参数匹配控制比较进一步表明 q/v 优势是结构性的,而不是纯粹参数性的。基准测试、选定的适配器和代码可在 https://github.com/EugPal/rag-lora-tradeoffs 上获取。