论文
命令式干扰:大语言模型 中的社会语域影响指令拓扑
Imperative Interference: Social Register Shapes Instruction Topology in Large Language Models
摘要
英语配合的系统提示指令与西班牙语相互竞争,语义内容相同,但交互拓扑相反。我们提出了跨四种语言和四种模型的指令级消融实验,表明这种拓扑反转是由社会语域介导的:命令语气在语音社区中具有不同的强制性力量,并且在多语言数据上训练的模型已经学习了这些约定。单个指令块的声明式重写将跨语言方差减少了 81%(p = 0.029,排列测试)。重写十一个命令式块中的三个将西班牙语指令拓扑从竞争性转变为合作性,并对未重写的块产生溢出效应。这些发现表明,模型将指令处理为社会行为,而不是技术规范:“永远不要做 X”是一种权力的行使,其力量取决于语言,而“X:禁用”是跨语言转移的事实描述。如果语域在推理时调解指令遵循,那么它在训练期间似乎也会这样做。我们将此作为一个可检验的预测:以命令语气编写的宪法人工智能原则可能会产生依赖于语言的一致性。语料库:针对生产系统提示的 22 个手工编写的探针,分解为 56 个块。