论文

理性综合者还是启发式追随者?分析基于RAG问答中的LLM

Rational Synthesizers or Heuristic Followers? Analyzing LLMs in RAG-based Question-Answering

模型评测模型行为与机制分析

摘要

检索增强生成(RAG)是为大语言模型(LLM)提供事实依据的主流范式,但模型整合成组冲突检索证据的机制仍不透明。LLM以某种方式回答,是因为证据在事实层面很强,是因为先验信念,还是仅仅因为证据被频繁重复?为回答这一问题,我们提出GroupQA,一个精心整理的数据集,包含1,635个争议性问题,配以15,058份来源多样的证据文档,并标注了立场与定性强度。通过受控实验,我们刻画了组级证据聚合动态:改述一个论点可能比提供不同的独立支持更具说服力;模型更偏爱先呈现而非后呈现的证据;而且越大的模型越抗拒适应所呈现的证据。此外,我们发现LLM对基于组的答案的解释是不忠实的。总的来说,我们表明LLM一致地表现为易受影响的启发式追随者,这对改进RAG系统设计具有直接启示。