论文

AtManRL:通过可微的注意力显着性实现忠实推理

AtManRL: Towards Faithful Reasoning via Differentiable Attention Saliency

模型训练奖励建模与过程监督

摘要

大语言模型 (LLM) 越来越依赖思维链 (CoT) 推理来解决复杂任务。然而,确保推理轨迹既有助于并忠实反映模型最终答案背后的过程,而不仅仅是伴随它,仍然具有挑战性。我们引入了 AtManRL,一种利用可微分注意力操纵通过强化学习学习更忠实推理的方法。通过训练一个附加注意力掩模来识别 CoT 中对于生成正确答案至关重要的标记,我们得出了一个显着性奖励信号,该信号鼓励模型生成真正影响其最终预测的推理轨迹。我们将这种显着性奖励与 GRPO 框架内基于结果的奖励相结合,共同优化正确性和可解释性。使用 Llama-3.2-3B-Instruct 在 GSM8K 和 MMLU 上进行的实验表明,我们的方法可以识别有影响力的推理标记,并能够训练更透明的推理模型。