论文
RESCUE:通过强化学习修复稀疏电路的语言模型错误
RESCUE: Repairing Language Model Errors to Sparse Circuits via Reinforcement Learning
摘要
大语言模型(LLM)表现出强大的通用能力,机制可解释性归因于稀疏的计算电路。然而,现有的电路研究强调保留功能或解释安全性,而在更广泛的任务中导致故障的机制基本上未被探索。将电路分析从能力扩展到错误,我们探讨了这样的观点:此类故障同样可能是由错误的内部计算引起的,并且有针对性地调整相应参数可以纠正此类错误,同时在很大程度上保留其他能力。受这一见解的启发,我们引入了RESCUE(推理错误稀疏电路发现和编辑),这是一个框架,可以定位与错误相关的电路并通过手术修复它们以增强性能。一般任务通常涉及多步推理和长格式生成,其中早期偏差可能会导致前缀偏离受监督的参考,从而导致基于 SFT 的掩模优化忽略涉及生成时错误的电路。因此,RESCUE 通过强化学习和多个屏蔽模型的rollout来完善这些屏蔽,从而提高它们与观察到的任务失败的相关性。最后,RESCUE 引入了剪枝技术,并精确微调错误电路以纠正任务失败,从而将错误定位转化为稀疏且有针对性的模型更新。我们在两个领域的异构修复集上验证了 RESCUE:(1)数学推理,识别密度为 1.40% 的数学错误电路,其修复将准确率从 6.0% 提高到 75.5%; (2) 医疗 QA,其中类似的紧凑型 1.44% 电路将修复装置精度从 0% 提高到 81%。我们的代码位于:https://github.com/chuanpupig/RESCUE.