论文
引文越细越好吗?重新思考属性生成的粒度
Are Finer Citations Always Better? Rethinking Granularity for Attributed Generation
摘要
引用粒度——无论是引用单个句子、段落还是文档——是归因生成中的关键设计选择。虽然细粒度引用通常是精确的人工验证的首选,但它们对模型性能的影响仍未得到充分探索。我们分析了四种模型规模 (8B-120B),并证明,相对于表现最佳的粒度,实施细粒度(句子级)引用会损失 2-97%(中位数 40%)的收益,并且在单个任务上损失高达 338% 的收益。引人注目的是,将引文粒度设置为最佳值(基于归因质量)可以释放这些实质性收益,同时使总体答案正确性基本保持不变(在 -2.3% 和 +4.4% 之间)。我们观察到一种一致的模式,其中归因质量在中间(段落级)粒度处达到峰值:更精细的引用似乎切断了支撑主张所需的语义依赖性,而过于粗略的引用会引入分散注意力的噪音。重要的是,这种性能差距随着规模的不同而变化:当一个主张基于少量或中等数量的证据时,它会破坏较大模型所擅长的多句子信息合成,从而对它们造成不成比例的惩罚。细粒度引用的前提是句子本身就是一个充分的证据单位。我们的结果表明通常情况并非如此,这是模型的属性而不是引用标准的属性。因此,为人类可验证性而制定的标准可能会自相矛盾地降低他们旨在确保的归属;有效的归因需要将粒度与模型的语义范围相匹配,而不是按惯例固定它。