论文
信任但要验证:DAVinCI——语言模型论断推理的双重归因与验证框架
Trust but Verify: Introducing DAVinCI -- A Framework for Dual Attribution and Verification in Claim Inference for Language Models
摘要
大语言模型(LLM)在广泛的NLP任务中展现出出色的流畅性和通用性,但仍然容易出现事实错误和幻觉。这一局限在医疗、法律和科学传播等信任与可验证性至关重要的高风险领域构成重大风险。本文提出DAVinCI——一个旨在增强LLM输出事实可靠性与可解释性的双重归因与验证框架。DAVinCI分两个阶段运行:(i)将生成的论断归因到内部模型组件和外部来源;(ii)使用基于蕴含的推理和置信度校准验证每个论断。我们在包括FEVER和CLIMATE-FEVER在内的多个数据集上评估DAVinCI,并将其性能与仅验证的标准基线进行比较。结果表明,DAVinCI显著提升了分类准确率以及归因精确率、召回率和F1分数,提升幅度为5-20%。通过广泛的消融研究,我们分离出证据片段选择、重新校准阈值和检索质量的贡献。我们还发布了模块化的DAVinCI实现,可集成到现有LLM流水线中。通过连接归因与验证,DAVinCI为可审计、可信赖的AI系统提供了一条可扩展的路径。这项工作为让LLM不仅强大而且可问责的持续努力做出了贡献。
