论文

大语言模型中的幻觉检测与缓解

Hallucination Detection and Mitigation in Large Language Models

模型推理推理验证与自校正

摘要

大语言模型(LLM)与大型推理模型(LRM)为金融、法律等高风险领域提供了变革性潜力,但它们产生幻觉——生成事实错误或缺乏支持的内容——的倾向构成关键的可靠性风险。本文引入一个综合的幻觉管理运营框架,建立在由根因意识驱动、以持续改进循环为核心的基础之上。我们将幻觉来源归为模型、数据与上下文相关因素,从而可以采取针对性干预而非通用修补。该框架整合了多方面的检测方法(如不确定性估计、推理一致性)与分层缓解策略(如知识接地、置信度校准)。我们通过一个分层架构和一个金融数据抽取案例研究展示其应用,其中模型、上下文与数据层构成渐进式可靠性提升的闭环反馈。该方法为在受监管环境中构建可信赖的生成式 AI 系统提供了系统化、可扩展的方法论。

大语言模型中的幻觉检测与缓解
图 1:幻觉检测和缓解系统。该框架实施了一个持续改进周期,其中检测和缓解策略的设计都是为了解决潜在的根本原因。该系统通过迭代测试和完善而不断发展。