论文
AtomEval:事实验证中对抗性声明重写的有效性感知原子评估
AtomEval: Validity-Aware Atomic Evaluation of Adversarial Claim Rewriting in Fact Verification
摘要
大语言模型(LLM)可以重写被驳斥的主张以逃避基于证据的事实验证者,但是当重写改变、削弱或纠正它们应该保留的错误命题时,传统攻击成功率(ASR)可能会被夸大。我们介绍 AtomEval,一种用于固定证据对抗性主张重写的有效性感知评估协议。 AtomEval 将声明表示为主语-关系-客体-修饰符 (SROM) 原子,应用单向保留门将有效验证者规避与命题更改重写分开,并报告有效性感知攻击成功率 (VASR),该成功率仅计算保留原始假命题的验证者规避重写。 AtomEval 进一步提供了细粒度的诊断,可以解释命题级故障和非最小有效重写。在 FEVER 驳斥声明重写中,AtomEval 揭露并解释了 ASR 膨胀:许多明显的攻击通过改变、削弱或纠正验证者应保留的命题来愚弄验证者。通过使受攻击命题保留变得明确且可测量,AtomEval 为评估对抗性重写器提供了一个稳定的评估目标,该重写器必须平衡验证者规避与命题保留。