论文

自解释训练 大语言模型 忠实性

Training Large Language Models for Self-Explanation Faithfulness

模型训练强化学习

摘要

我们提出了一种强化学习(RL)方法来直接优化自我解释的忠实性——模型生成的推理准确反映其内部决策过程的程度。虽然现有的工作重点是评估 忠实性 或使用推理时间提示框架来提高 LLM 的自我解释的易处理性,但这些方法没有提供直接优化模型参数以生成忠实自我解释的机制。我们通过将现有的 忠实性 指标修改为 RL 训练目标来弥补这一差距。我们研究(1)是否可以训练模型来准确检测影响其决策的因素,以及(2)强化学习是否可以直接优化这些因素的披露,从而改进 LLM 自我解释的 忠实性。我们使用从 Phi-CCT 相关性度量导出的每个样本奖励,尝试两种干预类型:随机词插入和用户偏差插入。 RL 微调的 Llama3.1-8B 和 Qwen3-8B 显示出 Phi-CCT 忠实性 指标的显着改进,分布内得分从接近零上升到高达 0.664,而在 StrategyQA 等保留任务上,分布外得分高达 0.691。交叉干预泛化较弱,但更有趣:先验我们不会期望仅在随机单词插入上训练的模型能够泛化到用户偏见短语,但 Llama3.1-8B 在这个方向上显示出非零转移。相反的方向和 Qwen3-8B 没有复制这一点,这表明我们还无法解释与模型相关和与设置相关的效应。最后,我们分析模型行为,以排除经常困扰 RL 训练的奖励游戏行为。最终,我们表明可以训练模型来隐式识别影响因素并公开它们,从而为减少 LLM 中的不忠实推理提供可扩展的路径。