论文

信仰:通过整合可信度和诚实来符合事实

FAITH: Factuality Alignment through Integrating Trustworthiness and Honestness

模型训练强化学习

摘要

即使 大语言模型 (LLM) 拥有相应的知识,也可能生成与事实不准确的内容,这严重损害了其可靠性。现有方法试图通过在训练期间将不确定性纳入 QA 提示来缓解这一问题,但这些数字分数缺乏 LLM 的语义丰富性,无法正确理解其可信度和诚实的内部状态,从而导致事实对齐不足。我们引入了 FAITH(通过集成可信度和诚实度进行事实对齐),这是一个用于事实对齐的 后训练 框架,它将自然语言不确定性信号与外部知识集成在一起。具体来说,我们通过计算 LLM 输出的置信度分数和语义熵并将它们映射到知识状态象限来增强训练数据集,该知识状态象限描述模型的内部知识拥有(可信度)和用自然语言回答行为(诚实性)。基于这些增强的数据,我们设计了一个同时考虑正确性和不确定性信号的奖励函数,并使用近端策略优化(PPO)算法对 LLM 进行微调。为了进一步缓解证据依据不足的回答,我们设计了一个检索增强模块,用于检索相关的外部段落,提高内部和外部知识表示之间的一致性。对四个知识密集型基准的广泛实验表明,FAITH 提高了 LLM 的事实准确性和真实性。