论文

让大语言模型说出他们的想法:衡量和改进 CoT-可解释性一致性

Making LLMs Say What They Think: Measuring and Improving CoT-Interpretability Alignment

模型评测评测方法与指标

摘要

思维链 (CoT) 轨迹通常可以作为大语言模型 (LLM) 如何得出答案的代理。然而,越来越多的证据表明,模型的 CoT 通常无法反映其内部计算,并且可以在不影响其最终答案的情况下进行更改。在这项工作中,我们衡量并改进了大语言模型 CoT 中描述的推理与其内部计算内容之间的一致性。我们提出了 CoT-可解释性对齐 (CIA),这是一种衡量模型的 CoT 轨迹与可解释性工具检测到的内部推理策略之间一致性的指标。我们评估了三个大语言模型在三项任务(两跳问答、提示干预和整数乘法)上的 CIA,发现大语言模型在所有任务上表现出有限的一致性 (44.8-75.9%)。然后,我们尝试通过训练后改进 CIA,将任务准确性和参数忠实度信号设置为奖励。实验表明,我们可以在保持或提高任务准确性的同时大幅提高 CoT 参数忠实度。我们提供丰富的分析,例如它们的泛化模式。我们的工作既提供了一个用于审核 CoT 参数忠实度的框架,也提供了一条使模型的显式推理更值得信赖的途径。代码和数据可在 https://github.com/yihuaihong/CIA-minimal-repro. 获取