论文
重叠、独特和冲突:大语言模型能否提取他们可以识别的内容?
Overlap, Unique and Conflict: Can LLMs Extract What They Can Recognize?
摘要
理解多视角另类叙述需要确定不同来源的信息如何一致、冲突或不同。现有的跨文本关系工作主要集中于对预定义文本对之间的关系进行分类,例如蕴涵或矛盾,而不是直接从完整的叙述中提取此类信息。为了解决这一差距,我们引入了重叠唯一冲突(OUC)提取,这是一种跨叙述任务,可以从两个叙述中提取所有重叠、冲突和独特的子句。为了支持这项研究,我们构建了大约 22K 个叙述对和 140K 个 OUC 实例的基准,涵盖事实、辩论和政治话语。通过评估 14 个开源 LLM(0.6B-35B),我们发现独特信息比重叠和冲突更容易提取:最强的模型 Gemma-4-31B 在重叠方面仅达到 61.13% 的 F1 分数,在冲突方面仅达到 48.58% 的 F1 分数,而在独特方面则超过 75%。进一步的诊断分析表明,这种困难不仅仅源于关系识别,而是由于未能从完整的叙述中配对和提取相应的子句,尤其是在较小的模型中。然而,通过特定于任务的监督来学习这些提取可以大大缩小差距:经过微调的 Qwen-3-8B 比其基线绝对提高了 15-28%,并且在多项任务上超过了其大小大约四倍的模型(例如 Qwen-3.6-35B)。即便如此,重叠和冲突仍然远低于令人满意,这使得跨叙述子句提取成为一个公开的挑战。