论文

幻觉自我对弈:通过进化生成器引导强化检测器

Hallucination Self-Play: Bootstrapping Reinforced Detector via Evolved Generator

模型训练强化学习

摘要

由于缺乏高质量的注释数据,识别 LLM 生成的输出中的 忠实性 幻觉仍然具有挑战性。最近的工作依赖于先进的 LLM 来综合训练数据,包括基本原理、标签和幻觉声明。然而,这些方法将发生器视为静态组件,限制了检测器的迭代改进。为了解决这个限制,我们引入了幻觉自对弈(HSP),这是一种新颖的框架,使检测器能够使用进化的生成器进行引导。 HSP 涉及从同一基本模型初始化的两个角色:一个评估模型输出的 忠实性 的检测器,以及一个产生越来越难以检测的幻觉响应的生成器。具体来说,检测器首先根据人类标记的数据进行微调,然后用作奖励模型,通过人工智能反馈(RLAIF)的强化学习来训练生成器。反过来,进化后的生成器会合成幻觉数据,通过基于规则的强化学习进一步优化检测器。 RAGTruth 基准和两个模型系列的实验表明,所提出的框架可以逐步增强小型 LLM,以匹配甚至超越高级 LLM,而无需外部监督。我们的代码可在 https://anonymous.4open.science/r/Hallucination-Self-Play-50B5 ​​获取。