论文

通过因果追踪了解语言实现选择对 LLM 立场的影响

Understanding the Impact of Linguistic Realization Choices on LLM Stance with Causal Tracing

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 已知对提示和输入公式敏感。然而,现有的研究主要集中在词汇实现上,而很大程度上忽视了结构选择。本文研究了语言构建是否可以系统地改变 LLM 决策,以及这些转变可以在模型内部因果定位。我们使用政治立场判断作为意义敏感的案例研究,并扩展英语政治声明数据集,产生六种受控的语言重写类型,保留或反转声明的含义。对四个开放权重模型的实验表明,立场不稳定性会影响意义保留和意义反转重写。因为输出变化表明重写影响姿态,但不影响模型中的位置,所以我们应用激活修补,其中原始语句的激活被替换到重写语句的前向传递中,并测量哪些组件恢复原始姿态分布。结果表明,中后期解码器层,尤其是最终提示位置的块输出,提供最强的恢复信号。