论文
权威性、真实性和引用偏差:研究 大语言模型 认知敏感性的大规模多领域基准
Authority, Truth, and Citation Bias: A Large-Scale Multi-Domain Benchmark for Studying Epistemic Susceptibility in Large Language Models
摘要
大语言模型 越来越多地部署在引文增强环境中,但引文存在对独立于事实内容的模型行为的影响仍然知之甚少。我们引入了 AuthorityBench,这是一个包含 220,564 个提示的多领域基准测试,它隔离了基于引用的权威信号如何影响 LLM 中的认知行为。该基准采用完全平衡的 2x2 因子设计,将声明准确性与引文准确性交叉,这是第一个跨四个领域(常识、科学、法律和医学)这样做的设计,具有超过 40 个提示模板的受控变化、四个场地声望等级和一个国家/地区编码的作者姓名数据集。通过评估 12 个结构化研究问题的 7 个模型,我们发现,相对于无引用基线,引用的存在,无论是真实的还是捏造的,都会持续增加幻觉率。当捏造的引文伴随着真实的主张时,效果最为强烈,使幻觉率提高 3 至 22 个百分点,在常识领域达到 35 至 77%,而法律主张相对强劲,场地声望和作者人口统计数据的影响可以忽略不计。所有数据集和评估代码均可在以下网址获取:https://github.com/floating-reeds/AuthorityBench