论文
RAGognizer:通过检测头集成实现幻觉感知 微调
RAGognizer: Hallucination-Aware Fine-Tuning via Detection Head Integration
摘要
检索增强生成 (RAG) 广泛用于使用外部信息(例如最近的或特定领域的知识)来增强 大语言模型 (LLM) 的输入。尽管如此,当前的模型仍然会产生封闭域幻觉并生成检索到的上下文不支持的内容。当前的检测方法通常将幻觉视为事后问题,依赖于黑盒一致性检查或对冻结内部表征的探测。在这项工作中,我们证明基于内部状态表示的幻觉检测也可以用作直接训练信号。我们引入了 RAGognize(带有 词元级 注释的自然发生的闭域幻觉数据集)和 RAGognizer(一种幻觉感知 微调 方法,它将轻量级检测头集成到 LLM 中,从而可以联合优化语言建模和幻觉检测。这个联合目标迫使模型提高其关于幻觉的内部状态的可分离性,同时学习生成格式良好且有意义的响应。在多个基准测试中,RAGognizer 实现了最先进的 词元级 幻觉检测,同时大幅降低生成过程中的幻觉率,而不会降低语言质量或相关性。