论文

看似无害的数据,潜在的意识形态:微调中的意识形态泛化 LLM

Innocuous-Seeming Data, Latent Ideology: Ideological Generalisation in Finetuned LLMs

模型评测模型行为与机制分析

摘要

在小型、精选数据集上微调语言模型是使其适应特定策略或领域的标准做法。我们表明,对狭隘的、事实上可辩护的、适度传递的数据进行微调可以在不相关领域引起广泛的意识形态转变,同时保留一般能力。对 GPT-4.1 进行右倾或左倾经济学问答训练,可以在刑事司法、环境和文化品味等主题上产生匹配的意识形态转变。同样的效果也出现在看似合理部署的数据集上,例如工作场所人力资源政策和实际财务查询,以及科学-伪科学轴上,其中食品安全微调增加了与表达错误健康信念的用户的阿谀奉承。我们将这种现象称为意识形态泛化,并提出了一种衡量两个属性的方法:广度,即这种转变在训练中未涉及的主题上达到的程度;以及放大,即相对于相同示例的几次提示,微调会强化转变的程度。我们表明,少量的提示表明了泛化的方向,但微调将模型推向了进一步的极端,包括远远超出分布的输出,例如对种族智商联系和政治暴力的认可。该效果在 Gemma-3 上复制,在无评判评估和外部基准测试下保持不变,与通用数据混合后仍然存在,并使 GSM8K 精度保持在基线的 $\pm 1$pp 范围内。