论文

一种基于去除的方法以提升LLM在测试时的忠实性

A Removal Based Approach to Improve LLM Faithfulness at Test-Time

模型推理推理验证与自校正

摘要

大语言模型(LLM)正越来越多地用于重要决策,其解释成为审计模型行为的重要工具。然而,这些解释可能不忠实,无法反映模型决策背后的真正推理过程。我们考虑一种场景,即LLM对问题的回答和解释同时提供。我们识别出解释不忠实的两个维度:不完整,即解释遗漏了影响答案的因素;不严谨,即解释引用了未影响模型答案的因素。现有提升LLM忠实性的方法包括训练时方法,需要访问模型权重并消耗大量计算资源,以及主要针对不严谨性的测试时方法。我们提出一种测试时方法,直接针对不完整问题。该方法从输入中移除模型解释中未提及的概念,并基于缩减后的输入重新查询模型。这消除了未被提及的影响因素,同时保留了被提及概念的影响。在两个数据集、多个模型家族以及两个独立的忠实性评估指标上,我们的方法相较于标准提示和鼓励忠实性的提示策略,均能提升解释的忠实性。该方法模型无关,可在推理阶段应用且无需修改模型参数,为减少隐藏影响、提升LLM辅助决策的可靠性和安全性提供了一种灵活机制。

一种基于去除的方法以提升LLM在测试时的忠实性:论文配图
图 6:Qwen3.5-27B 的每个概念 CEz\mathrm{CE}_{z} 与 EEz\mathrm{EE}_{z},每种方法一个面板。红色:用 90%90\% CI 拟合 EEz=rCEz\mathrm{EE}_{z}=r\,\mathrm{CE}_{z};虚线:忠实的 EEz=CEz\mathrm{EE}_{z}=\mathrm{CE}_{z}。阴影带标记隐藏的概念 (CEz−EEz>1\mathrm{CE}_{z}-\mathrm{EE}_{z}>1) 和不健全的概念 (EEz−CEz>1\mathrm{EE}_{z}-\mathrm{CE}_{z}>1) 及其计数。删除包装器清除了最隐藏的概念,而组合方法则清除了最不健全的概念。示例内没有 CE 差异的项目将被省略。