论文
Socrates-RAG:针对协调证据中毒的前提定向调查
Socrates-RAG: Premise-Directed Inquiry against Coordinated Evidence Poisoning
摘要
检索增强生成(RAG)防御通常决定如何过滤或聚合固定的检索集。然而,在开放语料库问答中,初始上下文中可能不存在决定性证据,但可以检索,这使得下一个查询成为可靠性问题的一部分。我们引入了 Socrates-RAG,一种以前提为导向的主动检索策略,它代表相互竞争的答案,选择一个未解决的前提,其解决方案将区分它们,并在回答或放弃之前使用新获得的证据来完善后续查询。我们将由此产生的有限预算证据状态形式化,并针对重复或主题查询策略提供有条件的救援保证。我们根据匹配控制来评估 Socrates-RAG,其中相同的主干网生成普通的面向相关性的搜索查询;两种策略共享初始证据、确定性检索器、两个查询/前三项预算、答案提示和无标签证据链发布规则。在不相交的 48 个世界反事实评估中,前提导向查询将安全准确度从 79.2% 提高到 93.8%,其中 8 胜、1 负、39 平(双边精确 p=.0391)。决定性证据召回率提高了同样的幅度,而不安全答案则从 1 下降到 0。两种策略都解决了所有 24 个一跳案例;增益集中在两跳情况下,其中 Socrates-RAG 将新解决的前提替换到其第二个查询中。这项对照研究隔离了前提定向采集的特定好处,但没有声称在开放网络上具有一般鲁棒性。