论文
案例:因果对齐和结构执行以改善思想链 忠实性
CASE: Causal Alignment and Structural Enforcement for Improving Chain-of-Thought Faithfulness
摘要
思想链 (CoT) 推理被广泛用于提高 大语言模型 (LLM) 的性能和可解释性,但生成的推理可能无法忠实地支持最终答案。我们从因果角度研究这个问题,一个忠实的CoT过程应该遵循$Z\rightarrow X\rightarrow Y$链,其中$Z$、$X$和$Y$分别表示指令、推理链和最终答案。在这个过程中,指令应该只通过推理链影响答案。然而,指令和 CoT 上的传统自回归 LLM 条件答案生成仍然允许直接指令到答案的快捷方式。为了解决这个问题,我们提出了 CASE,一个结合了训练时间因果对齐和推理时间结构执行的框架。在训练过程中,CASE 构建反事实 CoT、偏见指令和空指令数据集,并应用选择性损失 微调 来加强 CoT 到答案的依赖性,同时抑制指令快捷方式。在推理过程中,CASE 将直接注意力从指令标记屏蔽到答案标记,从而防止模型绕过生成的 CoT。我们提供信息论分析,展示这些组件如何促进忠诚链。对三个模型和四个基准的实验表明,与最强基线相比,CASE 在总体 CoT 忠实性 上实现了 37% 的平均每设置相对改进,表现出更强的跨数据集 忠实性 传输,并保持有竞争力的平均准确度。代码可在 https://github.com/oddwang/CASE 获取。