论文

哪里检索失败?评估农业咨询的 RAG 架构

Where Does Retrieval Fail? Evaluating RAG Architectures for Agricultural Advisory

模型评测模型能力评测

摘要

RAG 系统中的检索质量通常报告为单个聚合分数,这可以隐藏查询类型和语言条件之间的巨大差异。我们在孟加拉农业咨询中研究了这个问题,农民的询问通常是口语化的,而官方咨询文件则使用正式的科学术语。我们构建了从 284 份孟加拉国官方农业出版物中提取的 1,000 个查询和 2,882 个知识节点的测试集合,并用它来评估三种受控语言条件下的五种检索架构和六种嵌入模型。结果表明,没有一种检索方法始终是最佳的。对于本地孟加拉语查询,BM25 是最强的单个 检索器 (R@10 = 0.506),而混合 RRF 达到最高的总体 R@10 0.539。然而,密集检索性能因查询类型而异:R@10 在口语农民查询中为 0.093,在正式安全查询中为 0.970。在各种语言条件下,当英语查询与孟加拉语语料库匹配时,BM25 R@10 从孟加拉语查询的 0.506 下降到 0.004,而密集检索仅从 0.464 下降到 0.425。我们还发现,嵌入任务配置和通道长度都可以将报告的 R@10 改变七倍,与体系结构无关。这些结果说明了为什么低资源 RAG 评估应按语言条件和查询类型报告性能,而不是仅依赖总分。数据集和评估脚本可在 https://huggingface.co/datasets/RaiyanKhaan/AgriTrust-RAG 获取。