论文
FARCA:基于事实监督的强化学习的事实对齐可靠性感知信用分配
FARCA: Fact-Aligned Reliability-Aware Credit Assignment for Reinforcement Learning with Factual Supervision
摘要
为了减少通过具有可验证奖励的强化学习训练的 大语言模型 中结果驱动的奖励引起的幻觉风险,现有的缓解方法引入了过程级事实监督。然而,由于事实信号的粗粒度聚合以及缺乏对这些信号的可靠性评估,它们在事实验证和策略更新之间造成了不匹配。我们将这种问题称为含噪事实信用分配,并将其分解为两个方面:信用定位歧义和信用可靠性歧义。为了解决这些问题,我们提出了 FARCA(事实对齐的可靠性感知信用分配),这是一种策略优化框架,可将事实监督转化为本地化的、可靠性加权的 词元级 训练信号。 FARCA 通过将事实验证的粒度与策略更新的粒度结合起来,实现细粒度的信用本地化。它还引入了反事实证据归因,它利用事实判断对关键证据的依赖作为验证可靠性的经验代理来计算可靠性权重。这些权重调节事实奖励和本地政策优势,减少潜在不可靠信号 同策略 优化的影响。跨不同模型和多个事实推理基准的实验表明,FARCA 显着提高了模型的真实性,同时保留了一般推理能力。