论文
CAMS:让多文档摘要中的陈述直接关联原文证据
Attributable by Construction: Claim-Anchored Provenance for Multi-Document Summarization
摘要
大语言模型生成的多文档摘要往往只引用整篇文档或段落,且引用事后补充,难以逐句核验。本文提出CAMS,将来源追溯作为生成结构的一部分。系统把每篇文档拆为原子陈述,通过逐字引用确定其词元位置,聚合跨文档等价陈述并标记来源冲突,再选择有证据支持且重要的子集并改写。每个摘要句子末尾都带有可定位回原文的陈述标识符。作者区分可追溯性和忠实性:前者是每个输出句子都满足的结构约束,不依赖模型准确率;后者仅由筛选、受约束改写和核验促进,不能由可追溯性直接保证。研究在MultiNews、DiverseSumm及零样本WCEP上评估,分别考察无需参考答案的引用质量和与标准答案对齐的定位,并使用未参与筛选或核验的支持模型审计。CAMS保持较强基线的摘要质量,提高忠实性与引用精度,将多来源归因准确率由38%提高到64%,且未增加引用来源数量;每条陈述的人工核验耗时缩短至约原来的1/3.4。作者发布代码及约32万条MultiNews陈述—引用—位置标注。