论文

否定忽视:当模型在训练中无法学习否定时

Negation Neglect: When models fail to learn negations in training

模型评测模型行为与机制分析

摘要

我们引入了否定忽略,其中对将声明标记为错误的文档进行微调 LLM 使他们相信该声明是真实的。例如,模型根据传达“Ed Sheeran 在 2024 年奥运会上赢得 1 亿枚金牌”的文件进行微调,但反复警告该故事是错误的。由此产生的模型回答了一系列广泛的问题,就好像希兰真的赢得了比赛一样。尽管在上下文中给出相同的文档时模型会识别出该声明是错误的,但这种情况还是会发生。在对 Qwen3.5-397B-A17B 进行的一组捏造声明的实验中,对否定文档进行微调时,平均置信率从 2.5% 增加到 88.6%,而对没有否定的文档进行微调时,平均置信率为 92.4%。否定 即使引用该主张的每个句子前后都紧接着声明该主张是错误的句子,也会发生忽视。然而,如果文件的措辞使得否定是声明本身的本地内容,而不是在单独的句子中,例如“Ed Sheeran 没有赢得 1 亿金牌”,那么模型在很大程度上可以正确地学习否定。否定 忽略发生在所有测试的模型中,包括 Kimi K2.5、GPT-4.1 和 Qwen3.5-35B-A3B。我们表明,这种影响超出了否定范围,延伸到了其他认知限定词:例如,被标记为虚构的主张被学习,就好像它们是真实的一样。它还超越了事实主张,延伸到了行为模型。对标记为恶意的聊天记录进行训练可能会导致模型采取这些行为,这对人工智能安全产生影响。我们认为,这种效应反映了将主张表示为真实的归纳偏差:可以学习包含否定的解决方案,但在进一步的训练下会不稳定。