论文

语言模型知道什么不该说吗? LLM 中统计抢占的因果证据

Do Language Models Know What Not to Say? Causal Evidence for Statistical Preemption in LLMs

模型评测模型行为与机制分析

摘要

学习者如何在没有负面证据的情况下获得关于什么是不可接受的知识?建构语法提出了统计先发制人:接触传统形式(例如,“将书籍捐赠给图书馆”)抢占了结构上可能但未经证实的替代方案(“*向图书馆捐赠了书籍”)。我们提出了一项计算研究,首次在单一收敛设计中直接将统计抢占与 大语言模型 中的竞争性巩固假设分离。通过涵盖 120 个英语动词结构配对(与格、使役、方位)的四项实验,我们表明:(1) LLM 惊喜模式与人类可接受性判断密切相关 ($r = 0.79$),针对三个独立的行为数据集进行了验证; (2) 这些模式是由竞争形式频率而不是整体动词频率驱动的,这一点由非循环偏相关性证实; (3) 抢占敏感性尺度与模型大小呈幂律关系; (4) 受控的 微调 干预因果关系表明,操纵竞争形式的频率会沿预测方向改变抢占行为,而反向控制则排除了频率敏感性混杂。这些结果提供了一致的证据,表明神经语言模型通过分布竞争(构式语法提出的核心机制)获取负面语言知识。