论文
KARL:通过知识边界感知强化学习减轻 LLM 中的幻觉
KARL: Mitigating Hallucinations in LLMs via Knowledge-Boundary-Aware Reinforcement Learning
摘要
使 大语言模型 (LLM) 能够适当地避免回答超出其知识范围的问题对于减轻幻觉至关重要。虽然现有的强化学习方法促进自主弃权,但它们经常会损害答案的准确性,因为它们的静态奖励机制与模型的知识边界无关,会导致模型过度谨慎。在这项工作中,我们提出了 KARL,这是一种新颖的框架,可以不断地将 LLM 的弃权行为与其不断发展的知识边界保持一致。 KARL 引入了两项核心创新:知识边界感知奖励,利用组内响应统计数据进行在线知识边界估计,动态奖励正确答案或引导弃权;两阶段强化学习训练策略首先探索知识边界并绕过“弃权陷阱”,随后将超出知识边界的错误答案转换为弃权,而不牺牲准确性。对多个基准的大量实验表明,KARL 实现了卓越的准确性与幻觉权衡,有效抑制幻觉,同时在分布内和分布外场景中保持高精度。