论文
基于提示的弃权在误导性背景下失败:小型冻结 RAG 模型的对照研究
Prompt-Based Abstention Fails Under Misleading Context: A Controlled Study of Small Frozen RAG Models
摘要
缺失和误导性证据在检索增强生成(RAG)中并不是同一个问题,但基于提示的弃权对它们的处理是一样的。当上下文不存在时,模型就会弃权,而不是当上下文具有误导性时。我们引入了 GRAB-RAG(检索增强生成的分级放弃基准),这是一个配对基准,可在自然问题和 HotpotQA 中的四种上下文条件(支持、降级、缺失和误导)中测试相同的问题。在误导的情况下,我们编辑了一段标准证据段落来支持错误答案,并将其放置在其他检索到的段落中。我们在两个 QA 基准测试中对三个小型冻结模型 (3.8B--8B) 测试了五种弃权策略。当证据缺失时,模型会可靠地弃权,但在明确的弃权提示下,仍然回答了 41.6% 的误导性问题,其中 63% 的答案逐字呼应了植入的错误实体。思想链几乎没有带来额外的好处。生成器端冲突检查将比率降低至 13.3%,但丢弃了许多正确答案,而 NLI 验证器恢复了该覆盖范围,但当参数内存和误导性段落同意相同的错误答案时会失败。基于提示的弃权询问上下文是否充分,而不是它是否正确。如果不以安全为代价,验证者就无法缩小这一差距。