论文

BALTO:平衡 词元级 政策优化以缓解幻觉

BALTO: Balanced Token-Level Policy Optimization for Hallucination Mitigation

模型训练强化学习

摘要

幻觉仍然是在知识密集型环境中部署 大语言模型 (LLM) 的主要障碍,其中生成的响应必须忠实地基于提供的证据。强化学习(RL)是缓解幻觉的一个有前途的方向,但响应级别的 忠实性 奖励存在粒度不匹配的问题:局部幻觉可能导致支持的内容受到虚假惩罚。尽管最近的工作引入了细粒度的反馈,例如声明级验证和 词元级 奖励,但不平衡的贡献分配仍然会导致长度、冗长或优化噪声偏差。我们提出了 BALTO,一个用于缓解幻觉的平衡 词元级 策略优化框架。 BALTO 提取可检查的事实声明,根据参考上下文对其进行验证,并将声明级别的判断投影到 词元级 标签。框架中引入了平衡的词元级学分分配机制。这种设计将概率质量从不受支持的内容重新分配到忠实的内容,而不是抑制整个响应。我们从理论角度系统分析了响应级别奖励的局限性,并证明了 BALTO 在缓解幻觉的训练稳定性和优化效率方面的优势。 ConFiQA、RAGTruth 和 FinLLM-Eval 上的实验表明,BALTO 在所有六个模型基准设置中实现了最高的 忠实性,并且在 Q-Score 中始终优于现有的 后训练 基线,展示了更强的 忠实性(信息性权衡)。