论文
AstroRAG——用于天文学问答的基于Pagerank的检索增强生成管道
AstroRAG -- A Pagerank-Based Retrieval-Augmented Generation Pipeline for Question Answering in Astronomy
摘要
大语言模型 (LLM) 在自然语言处理方面表现出强大的性能,但在仅依赖参数知识时经常会产生事实错误。检索增强生成 (RAG) 通过将响应基于外部证据来减轻这些错误,但传统的检索和转储方法经常引入不相关的上下文,从而降低答案质量。在这项工作中,我们提出了 AstroRAG——一种基于 PageRank 的检索增强生成 (RAG) 管道,适用于天文学中的问答。该系统在 Elasticsearch 中执行词元感知分块和按实例的临时索引,然后执行两阶段检索:(i) 最大边际相关性 (MMR) 以获得小型、多样化的候选集,以及 (ii) 在相似性图上进行读者驱动的 PageRank (PR) 重新排名,以在严格的 词元预算 下识别紧凑、相互支持的上下文。我们的设计是 无需训练,隐私保护且可复制,因为每个实例都通过瞬态索引进行处理,以防止跨任务泄漏。我们根据天文学 QA 的 AstroQA 基准评估该流程,并在所有难度级别上展示具有竞争力的性能。特别是,RAG 增强型 Mistral-7B 实现了 \textbf{79.49\% 准确度} 和 \textbf{79.49\% F1 分数},几乎是非 RAG 对应产品性能的两倍。这些结果凸显了规范检索和细化在促进特定领域推理方面的有效性,为将 RAG 扩展到其他科学领域奠定了坚实的基础。