论文
AuthorityBench:可靠检索增强生成的 LLM 权威感知基准测试
AuthorityBench: Benchmarking LLM Authority Perception for Reliable Retrieval-Augmented Generation
摘要
检索增强生成 (RAG) 通过外部知识增强了 大语言模型 (LLM),但仍然容易受到可能传播错误信息的低权威来源的影响。我们研究 LLM 是否能够感知信息权威——一种超越语义理解的能力。为了解决这个问题,我们引入了 AuthorityBench,这是一个用于评估 LLM 权威感知的综合基准,包含三个数据集:DomainAuth(具有基于 PageRank 的权威的 10K 个 Web 域)、EntityAuth(具有基于流行度的权威的 22K 实体)和 RAGAuth(具有不同权威的文档的 120 个查询,用于下游评估)。我们使用三种判断方法(PointJudge、PairJudge、ListJudge)在多种输出格式中评估五个 LLM。结果表明,具有 PointScore 输出的 ListJudge 和 PairJudge 与 真值 权威的相关性最强,而 ListJudge 提供了最佳的成本效益。值得注意的是,合并网页文本会持续降低判断力,这表明权威与文本风格不同。 RAG 的下游实验表明,权威引导的过滤很大程度上提高了答案的准确性,验证了权威感知对于可靠知识检索的实际重要性。代码和基准可在以下位置获取:https://github.com/Trustworthy-Information-Access/AuthorityBench。