论文
通过从多个不完美指标中进行偏好学习来优化摘要中的事实一致性
Optimising Factual Consistency in Summarisation via Preference Learning from Multiple Imperfect Metrics
摘要
以评估指标作为奖励的强化学习被广泛用于增强语言模型的特定能力。然而,对于事实一致的总结等任务,现有指标仍然不发达,限制了它们作为塑造模型行为信号的有效性。虽然单个事实指标不可靠,但它们的组合可以更有效地捕获不同的事实错误。我们利用这种洞察力引入了一个自动化训练管道,通过聚合不同弱指标的分数来提高摘要中的事实一致性。我们的方法通过将分数映射到偏好并过滤掉指标之间高度不一致的案例,避免了复杂的奖励塑造。对于每个源文档,我们通过不同的解码策略生成词汇上相似的摘要对,使模型能够从细微的词汇差异引起的事实差异中学习。这种方法仅使用源文档构建高质量的偏好数据集。实验证明了跨模型一致的事实性增益,从早期的编码器-解码器架构到现代的 大语言模型,较小的模型达到了与较大模型相当的事实性。