论文
HERALD:检索证明奖励的反事实审计与最小修复
HERALD: Counterfactual Audits and Minimal Repairs for Proof-of-Retrieval Rewards
摘要
搜索代理奖励混合答案质量、引用的证据支撑、工具成本和抗欺骗术语;因此,高分并不意味着引用证据被检索到,并且附加惩罚可以抵消。我们引入HERALD,这是一种离线审计,应用相同的提问干预,分离候选可见信息与oracle信息,并在策略优化之前枚举检测器合同。在四个Qwen3-8B池(HotpotQA、2WikiMultiHopQA和MuSiQue)上,$R_0$拒绝搜索删除和伪造ID,但无标签的引文洗钱攻击成功。在$2^3$的完全性消融测试中,针对$L$(引用语料中存在、但检索证据里缺失的段落)的定向强化,是观测到的集合包含意义下的最小修复:$R[L]$的经验攻击成功率为零,单侧按簇上界为0.50%。该差距在规则、可见的BM25攻击者和四款模型上依然存在;更广泛的硬化在攻击移除oracle支持ID惩罚时仍然脆弱。在严格匹配5M-token训练,评估256对问题后,$R[L]$满足HotpotQA和2Wiki上的EM非劣性门槛,但在MuSiQue上未通过该门槛。等效的引用精度和支持召回分别提高了2.02和1.46点,无证据支持的引用减少了1.69个百分点,而洗钱攻击能力在2Wiki和MuSiQue上也有所下降。$L$自然没有减少,检测器仅出现在58,368个训练轨迹中的18个。因此,HERALD将分离稳健评分、稀疏学习信号和策略转移。