论文

信任但要验证:DAVinCI——语言模型论断推理的双重归因与验证框架

Trust but Verify: Introducing DAVinCI -- A Framework for Dual Attribution and Verification in Claim Inference for Language Models

模型推理推理验证与自校正

摘要

大语言模型(LLM)在广泛的NLP任务中展现出出色的流畅性和通用性,但仍然容易出现事实错误和幻觉。这一局限在医疗、法律和科学传播等信任与可验证性至关重要的高风险领域构成重大风险。本文提出DAVinCI——一个旨在增强LLM输出事实可靠性与可解释性的双重归因与验证框架。DAVinCI分两个阶段运行:(i)将生成的论断归因到内部模型组件和外部来源;(ii)使用基于蕴含的推理和置信度校准验证每个论断。我们在包括FEVER和CLIMATE-FEVER在内的多个数据集上评估DAVinCI,并将其性能与仅验证的标准基线进行比较。结果表明,DAVinCI显著提升了分类准确率以及归因精确率、召回率和F1分数,提升幅度为5-20%。通过广泛的消融研究,我们分离出证据片段选择、重新校准阈值和检索质量的贡献。我们还发布了模块化的DAVinCI实现,可集成到现有LLM流水线中。通过连接归因与验证,DAVinCI为可审计、可信赖的AI系统提供了一条可扩展的路径。这项工作为让LLM不仅强大而且可问责的持续努力做出了贡献。

信任但要验证:DAVinCI——语言模型论断推理的双重归因与验证框架:论文配图
图 1:声明输入:该过程从文本声明开始,通常由语言模型生成或从语料库中提取。该声明用作归因模块的输入。归因模块:该模块识别支持或反驳主张的相关证据段落。它以两种模式运行:(a) 充分证据归因根据与主张的语义相似性检索整个段落。 (b) 基于跨度的归因使用问答模型提取特定的答案跨度,提供细粒度的归因。这两种策略提供了证据相关性的互补观点。证据输出:选定的证据被传递到下游进行验证。该中间输出可能包括黄金标准证据(来自带注释的数据集)或检索的证据(来自语料库)。验证模块:该组件使用基于变压器的蕴涵分类器来评估声明及其归属证据之间的关系。它输出来自“支持”、“驳斥”、“信息不足”集合的标签以及置信度分数 s\in[0,1]。置信度重新校准:为了减轻过度自信的错误分类,置信度分数通过阈值机制传递。如果分数 s 低于预定义的阈值 τ\tau,则无论原始预测如何,输出标签都会降级为 Not Enough Info#。这确保了在模棱两可的情况下做出保守的决策。最终输出:系统生成一个校准标签 - Supported#、Refulated# 或 Not Enough Info# - 反映蕴涵判断和置信度调整。这些输出可用于下游任务,例如事实检查、索赔过滤或人工参与审核。