论文
可操作的幻觉检测:将潜在的不确定性转化为代理批评
Actionable Hallucination Detection: Translating Latent Uncertainty into Agentic Critique
摘要
作为 AI 代理部署的 大语言模型 (LLM) 经常表现出未遵守用户要求,执行幻觉的、不期望的操作来强制解决,而不是表达不确定性。现有的检测方法无法提供可操作的实时校正,因为它们要么无法定位幻觉,要么会产生令人望而却步的推理延迟。我们引入了 Latent Critic,这是一种轻量级低秩适配器 (LoRA),它与冻结基础 LLM 的生成同时运行,以主动重组 Transformer 的残余流——放大潜在与用户要求对齐的信号并将其转换为单个序列中的本地化自然语言反馈。通过细化基本模型的本机不确定性信号,对潜在空间的这种操纵可以实现可靠、精细的检测,而无需二次推理循环的开销。通过激活修补和逐层探测进行的机制分析表明,这种秩不变行为将预先存在的不确定性几何结构重组为线性可分离的表示,该表示比单独的基础模型表示更可靠地传输。使用工具调用作为颗粒幻觉的实例,我们验证了 Latent Critic 架构在基于 Qwen 和 Llama 的模型中实现的检测和下游改进。我们的方法展示了卓越的实时功效,在隔离幻觉方面显着优于同等规模的微调外部探测器、语义熵基线和被动内部探测器,实现了 0.966 AUROC 和 >80% 的定位准确度(例如,缺乏依据的日期)。当部署在闭环 ReAct 环境中时,Critic 充当可忽略不计的延迟护栏,在执行之前拦截幻觉,以防止出现不需要的操作,同时利用这种特定的本地化反馈来实现高效的代理自我纠正。