论文
一种基于去除的方法以提升LLM在测试时的忠实性
A Removal Based Approach to Improve LLM Faithfulness at Test-Time
摘要
大语言模型(LLM)正越来越多地用于重要决策,其解释成为审计模型行为的重要工具。然而,这些解释可能不忠实,无法反映模型决策背后的真正推理过程。我们考虑一种场景,即LLM对问题的回答和解释同时提供。我们识别出解释不忠实的两个维度:不完整,即解释遗漏了影响答案的因素;不严谨,即解释引用了未影响模型答案的因素。现有提升LLM忠实性的方法包括训练时方法,需要访问模型权重并消耗大量计算资源,以及主要针对不严谨性的测试时方法。我们提出一种测试时方法,直接针对不完整问题。该方法从输入中移除模型解释中未提及的概念,并基于缩减后的输入重新查询模型。这消除了未被提及的影响因素,同时保留了被提及概念的影响。在两个数据集、多个模型家族以及两个独立的忠实性评估指标上,我们的方法相较于标准提示和鼓励忠实性的提示策略,均能提升解释的忠实性。该方法模型无关,可在推理阶段应用且无需修改模型参数,为减少隐藏影响、提升LLM辅助决策的可靠性和安全性提供了一种灵活机制。
