论文

复制上限:区分本体检索生成中的答案暴露与真正新增回答

The Copy Ceiling: An Input-Exposure Control for Ontology-Grounded Generation over Curated Corpora

模型评测评测方法与指标

摘要

语言模型通过图检索从整理过的语料回答问题时,基于证据生成的效果大幅提升并不能证明模型利用了检索结构进行推理,因为上下文可能已经包含标准答案。本文提出答案暴露核算,按展示的上下文是否暴露标准答案项、回答是否恢复该项进行分类。其标量参照是“复制上限”,即逐字复制上下文所能获得的召回率;相对复制的有符号增益衡量模型相比这一确定性、无需评分模型的基线增加了多少召回。在十个模型上,无辅助召回平均0.26,提供检索证据后平均0.92,但相对复制的增益全部为负,范围为-0.067至-0.022。共11360个标准答案项观测,对应1136个目标在十个模型下的评测,仅三个未暴露项获得词面匹配得分。对423个分层样本进行模型辅助审核,采用对称的引文核验规则,估计97.1%的获分项确实断言了所要求的关系;但三个未暴露获分项均未通过关系核验。对上下文未暴露的目标,无辅助词面召回为0.121,提供证据后降至0.004;关系审核确认无辅助的92个获分项中有71个有效,却未确认三个提供证据后的获分项,这不等于确定了完整关系结构的恢复率。把问题改写为图标题词汇之外的表达,暴露率由0.964降至0.328;缺失触发的回退机制在506个问题中只触发两次。成对生产测试的汇总评判质量提高0.27,但负对照未能证明这种收益超过了提供一段格式良好、来自同一语料的内容。结果支持把答案暴露核算用作语料派生评测的常规对照。它区分遗漏已暴露答案与恢复未暴露答案,并不直接判定是否发生推理。