论文

当 RAG 未能均衡时:事实问答中对上市公司的地理偏见

When RAG Fails to Equalize: Geo-bias in Factual Question Answering over Public Companies

模型评测鲁棒性、公平性与可信度评测

摘要

检索增强生成(RAG)被广泛认为可以减少 大语言模型(LLM)中的事实错误,但目前尚不清楚检索是否统一补偿了缺失的知识。我们在上市公司的受控事实 QA 环境中研究这个问题,构建了全球股票指数中约 2,000 家公司的基准。我们在四种条件下评估四个原子属性的六个 LLM:无上下文、完美上下文、误导上下文和干扰上下文。我们发现无上下文准确度存在很大的地理差异,表明参数知识不均匀。虽然完美的上下文可以提高性能,但它并不能消除这些差距:增益与基线准确性相关,这表明检索有效性与内部表征相关。在误导性的背景下,模型经常复制错误的信息。较大的模型可以提高整体性能,但不会消除这些结构效应。这些结果挑战了 RAG 作为通用校正的观点,并强调了模型知识、上下文质量和实体表示之间的相互作用。