论文

EviScope:用于忠实且高效的扎根语言模型的配对反事实证据诊断

EviScope: Paired Counterfactual Evidence Diagnostics for Faithful and Efficient Grounded Language Models

模型评测基准与评测资源

摘要

扎根的语言模型系统通常通过最终答案的准确性来评估,但正确的答案可能不受支持、来自错误的来源,或者在证据不足或矛盾时产生。我们引入了 EviScope,这是一个配对的反事实基准,它可以在固定问题的同时添加、删除、分散注意力或反驳其证据。 EviScope-v1.1 包含 40 个四条件四重奏,带有修复的反事实声明和用于自动评估的跨度级支持标签。在 Qwen2.5-7B、Llama 3.1 8B 和 Gemini 3.5 Flash 的 960 个金盲代中,配对指标揭示了模型相关的基础行为,而这些行为隐藏了准确性。在两个局部开放模型上,显式证据行动门在 QCS 上的表现低于普通 RAG:Qwen 为 0.15 vs. 0.50,Llama 为 0.10 vs. 0.375。 Gemini 在两种提示下均达到 0.944 的联合成功率,但在插入矛盾后仍回答了 5% 的冲突案例。因此,EviScope 会区分不受支持的回答、冲突盲目性和错误的非回答行为,而不是单独对答案进行评分。