论文
针对工业问答应用的 RAG 和 微调 评估
Assessment of RAG and Fine-Tuning for Industrial Question-Answering-Applications
摘要
大语言模型 (LLM) 越来越多地应用于企业问答 (QA) 系统,需要适应特定领域的知识。整合此类知识的最流行的方法是检索增强生成 (RAG) 和 微调 (FT)。然而,从成本与准确性权衡的角度来看,尚不清楚哪种方法最适合行业场景。本研究探讨了 RAG 和 FT 对汽车行业特定的两个封闭数据集的影响,评估答案质量和运营成本。我们扩展了 Erol 等人提出的通过成本框架。 (arXiv:2504.13359) 联合评估输出质量、生成成本和用户交互成本。我们的研究结果表明,虽然优质模型开箱即用时性能最佳,但开源模型在使用 RAG 增强后也能达到相当的质量。总体而言,RAG 成为闭源和开源模型最有效且最具成本效益的适应方法。