论文

出于什么原因?解释因果关系和对立模型的编码

For What Reason? Interpreting Models' Encoding of Causation and Antithesis

模型评测模型行为与机制分析

摘要

话语关系提供文档结构,这对于语言理解以及实现语言模型的性能和道德至关重要。在这项工作中,我们研究了指令调整的 Transformer 模型(LLaMA 和 Mistral)如何编码英语中的话语关系,特别关注因果关系和对立关系的对比关系。将任务构建为下一个词元预测任务,并应用一套可解释性技术来测试模型内部结构,我们的研究结果表明,某些早期层在中间序列词元处做出预测决策,而一些中间层在更接近最后一个词元时最终确定其决策。大多数剩余层主要传播早期决策,而不是积极影响它们。此外,我们观察到某些层表现出对一种答案的偏好,而不是其他答案,这表明基于话语的推理的不对称表示。\footnote{我们的代码可在 https://github.com/abhidipbhattacharyya/causation_vs_antithesis 上找到}