AtomCite:验证和更正多页文档中提供的页面级引文
AtomCite: Verification and Correction of Supplied Page-Level Citations in Multi-Page Documents
摘要
大语言模型 回答多页文档的问题预计会引用支持页面,但提供的引用有时不准确,并且当前的评估在生成时或针对文本段落对引用进行评分:没有现有的基准评估系统是否可以验证和更正已附加到答案的页面级引用。我们提出了 AtomCite,一个代理框架,它将答案解析为声明,根据其引用页面的图像检查每个声明,并应用确定性修复策略。为了对其进行评估,我们引入了 DocCite,据我们所知,这是验证和纠正文档图像中页面级引用的系统的第一个基准。它基于 MP-DocVQA 和 DUDE 构建,结合了 928 个经过验证的注入实例和从前沿层和效率层模型中收集的 2,468 个候选自然错误,其中两个注释器审核确认 1,909 个为真正错误。主要标签是确定性分配的,而不是由 LLM 法官分配,人工审核作为单独的验证层。在三个模型系列(Gemini、Claude 和 GPT)中,AtomCite 在注入基准上达到了约 93% 的二进制验证准确度,显着优于每个仅 OCR 条件(包括计算匹配控制),并超过了给定相同 OCR 文本的每个先前基于文本的基线。其修复策略将注入组合的引用精度从构建的 34% 提高到 87-90%,同时保留了超过 90% 的正确声明。 AtomCite 还进行了转移:通过冻结提示和零训练,它提高了两个开放 7-8B 模型在五个公共基准上的幻觉检测分数,高于作为直接评判提示的相同模型。最后,审计表明,自动标签中的噪声会影响验证者测量的准确性,并可能扭转系统排名,因此仅依赖合成或自动标签的评估存在误测验证能力的风险。