论文

AquiLLM:评估开放权重科研RAG系统的忠实性

AquiLLM: Evaluating Faithfulness in Open-Weight RAG-LLM Systems for Scientific Research

模型评测模型能力评测

摘要

科学研究越来越依赖于大型异构数据源,激发了人们对检索增强生成(RAG)系统的兴趣,该系统提供对科学知识和研究工作流程的自然语言访问。研究人员正在探索这些系统作为文档搜索和生成分析代码和管道组件的自然语言界面的可行性。与此同时,对数据隐私和对研究基础设施控制的担忧激发了人们对研究机构内托管的开放权重模型和开源部署的兴趣。在天文学中,这种发展遵循计算基础设施发展的悠久历史,从档案数据库和基于结构化查询语言(SQL)的系统到大语言模型(LLM)辅助的研究工具。本文提出了对 AquiLLM 忠诚度的领域专家评估,AquiLLM 是一个开放式、离线的 RAG-LLM 平台,旨在支持科学研究小组使用和保存隐性知识和形式知识。我们将忠实度定义为生成的响应仍然基于检索到的科学背景而没有未经支持的主张或遗漏的程度。我们报告了一项天文学案例研究的结果,该案例研究评估了 AquiLLM 的检索和科学分析任务。 AquiLLM 在基于 RAG 集合的显式检索导向问题上表现最可靠,而对于需要综合或歧义解决的查询,忠实度会降低。这些结果凸显了开放式 RAG-LLM 系统在科学研究中的前景和局限性,并证明了领域专家评估超越标准基准排行榜的重要性。

AquiLLM:评估开放权重科研RAG系统的忠实性:论文配图
图 1:高级 AquiLLM 架构。后台工作人员处理文档摄取和索引,而运行时请求则通过协调检索、内存和工具使用的提示编排层。通过 vLLM 提供本地推理服务,使用单独的模型进行聊天、嵌入、重新排名和多模态处理。