论文
HARPO:幻觉感知强化学习实现忠实与创造兼得
HARPO: Hallucination-Aware Reinforcement Learning for Faithful and Creative Language Generation
摘要
大语言模型易生成幻觉内容,损害其在知识密集任务中的可靠性。为在不牺牲创造力的前提下应对这一挑战,我们提出HARPO——联合优化忠实与创造的强化学习框架。HARPO纳入经可验证反馈训练的幻觉感知生成式奖励模型(HA-GRM),同时评估忠实与写作质量;选择性激活机制(SAM)仅对被HA-GRM判定无幻觉的输出激活写作奖励;数据课程渐进把训练从创意写作转向以幻觉为中心的任务。RAGTruth上,基于Qwen3-4B的HA-GRM达到78.08%的响应级F1(SFT基线66.37%)。在1.7B至8B参数的Qwen2.5与Qwen3模型上的实验显示忠实生成与写作质量双改善:Qwen3-4B上HARPO把MultiHopRAG的HA-GRM判定幻觉率从3.29%降至1.02%,同时把Arena-Hard-v2.0创意写作分从16.95%提升到27.54%。