论文

经证据链评估的校准选择性事实核查

Calibrated Selective Fact-Checking via Evidence Chain Evaluation

模型推理推理验证与自校正

摘要

大语言模型(LLM)能取得很强的事实核查准确率,但强制的二元决策掩盖了一个关键可靠性问题:即使支持证据薄弱、稀疏或内部不一致,系统也可能给出自信的裁决。我们以证据链评估(ECE)解决该问题——一个选择性事实核查框架:允许经“不确定”裁决弃权,而不是对每条论断强制真/假决策。被评估系统是一个使用工具的验证智能体:经网络搜索、学术搜索与可执行检查收集证据,然后返回带置信度与来源级元数据的结构化裁决。在ECE-Bench上,ECE取得91.6%的标准准确率、93.7%的覆盖率与已答论断上97.8%的选择性准确率。虽然ECE在期望校准误差、Brier分数或AURRC等聚合校准指标上不超过最强检索基线,但它提供了清晰的选择性预测权衡:在已答论断上保持极高准确率,同时95例中推迟6例;这些被推迟的案例集中在低可靠性证据设定(6例中5例在来源级L4),支持“弃权是处理认识论薄弱证据的安全导向机制”的观点。代码见https://github.com/cheshireyang/ECE.git。