论文

相关不等于有据:面向引用式RAG的证据力度校准

Relevant Is Not Warranted: Evidence-Force Calibration for Cited RAG

模型评测评测方法与指标

摘要

引用式RAG评估常把可见的来源视为落地信号,但一条真实且主题相关的引用仍可能不足以支撑所附措辞。我们将这一诊断失效问题化为引用漂白来研究:用一条相关来源充当过强论断的依据。我们提出FORCEBENCH,一个用于证据力度校准的对照式压力测试。每个条目固定所引用的片段,并将一条证据校准的论断与沿五个操作维度(关系、情态、范围、时间有效性与数值精确性)局部提升力度的变体配对。校准良好的评估器应给证据校准论断更高的分数。主实验使用固定的、经局部性过滤的198对评估集。引用存在性健全检查在设计上不具信息量;词元与实体重叠仍在32.8%-36.4%的对上违反单调性。在四个受测模型裁判中,标准通用支持提示不足以应对这一力度校准压力测试(汇总MVR为47.2%),显式的支撑强度提示可将MVR降至24.5%但仍不完美。我们发布基准、提示、输出与插件式流水线,使引用评估者能在常规支持度指标之外报告单调性违反率与力度敏感度。

相关不等于有据:面向引用式RAG的证据力度校准:论文配图
图 1:ForceBench 通过对比单调性评估引文洗钱行为。所引用的证据是固定的,而基准则将最强的有根据的主张与最低限度更强的过度主张进行对比。相同的局部测试在五个力轴上实例化:关系、模态、范围、时间有效性和数字特异性。经过校准的评估者应该为有保证的主张提供比过度主张更高的支持。