论文

从被动响应到主动纠正:增强 LLM 针对输入事实扰动的鲁棒性

From Passive Response to Proactive Correction: Enhancing LLM Robustness Against Input Fact Perturbations

模型推理推理验证与自校正

摘要

当用户输入包含误导性前提时,大语言模型 (LLM) 经常会产生自信但实际上不正确的响应,我们将这种现象归因于输入中的事实扰动。现有的缓解幻觉的方法通常假设可靠的用户输入,而忽略了此类事实错误如何主动误导模型推理。为了解决此漏洞,我们提出了 DEDUCE,这是一个三阶段框架,可将 LLM 从被动响应器转变为主动纠错器。 DEDUCE 分三个阶段运行:(1)通过细粒度事实提取和验证来检测错误; (2)多角度思考制定纠正策略; (3) 纠正误解,同时提供可靠的答案。我们还提出了 MisFactQA,一个包含不同程度事实错误的数据集,并提出了评估模型稳健性的新指标。在 TruthfulQA、FalseQA 和 MisFactQA 基准上的实验表明,DEDUCE 显着提高了准确性和纠错能力。 Qwen、LLaMA 和 Gemma 系列的持续增长证实了其有效性和可扩展性。