论文
CORTEX:通过比较内部表示在 RAG 中进行 词元级 幻觉检测
CORTEX: Token-Level Hallucination Detection in RAG via Comparative Internal Representations
摘要
在本文中,我们提出了 CORTEX,一种用于检索增强生成(RAG)的 词元级 幻觉检测方法。在长格式 RAG 输出中,幻觉通常出现在局部范围内,而不是整个响应中。因此,CORTEX 在 词元级 处识别出不可靠的内容,从而实现幻觉的细粒度定位。 CORTEX 背后的关键直觉是,基于检索文档的标记应该比幻觉标记更受这些文档的影响。为了捕捉这种文档引起的效果,CORTEX 在两种条件下比较 大语言模型 (LLM) 的内部表示:有和没有检索到的文档。 CORTEX 不是仅仅依赖于每个标记对检索到的文档的直接敏感性,而是通过前面的标记利用基于文档的信息的传播,减少证据已经被吸收到上下文中的标记的误报。最后,CORTEX 应用后处理平滑步骤来模拟幻觉标签在连续跨度上持续存在的趋势,减少局部噪声并鼓励跨度一致的预测。在两个 RAG 基准测试和三个 LLM 上进行的实验表明,CORTEX 显着改进了 词元级 幻觉检测,每个组件都始终有助于性能提升。