论文

小编辑,大模型:维基百科的倡导如何塑造 LLM 价值观

Small edits, large models: How Wikipedia advocacy shapes LLM values

模型评测模型行为与机制分析

摘要

一小群志愿者能否仅通过编辑维基百科来塑造人工智能系统讨论动物福利的方式?我们证明他们可以。维基百科出现在几乎所有主要语言的 模型训练 数据集中,并且比网络爬虫文本的权重更大。亲动物维基百科 (PAW) 是一群倡导者,他们将来源的动物福利内容添加到相关文章中,在 115 个页面上进行了 125 次编辑。使用基于梯度的数据归因(Bergson;MAGIC),我们追踪了这些编辑如何影响语言模型行为。 Llama 3.1 8B 上的 TrackStar 检索归因发现,PAW 编辑的部分占动物福利查询最高属性文档的 68% (p < 0.0001),但对于同一公司的不相关查询仅占 52% (p = 0.53):该模型将 PAW 内容专门链接到动物福利主题,而不是一般实体。对 Llama-3.2-1B 的 MAGIC 反事实影响力估计,在五个随机训练顺序种子中运行,更清晰地给出了相同的情况:在每个种子中,对动物福利查询最有影响力的前 10 个文档都是 PAW 编辑(10 个种子中的 10 个,5 个种子中的 5 个),而在一般查询中,相同的前 10 个文档是偶然的(10 个种子中的 4 到 6 个)。 PAW 的平均影响力超过了对动物福利查询的平均控制影响力,每个种子的 p < 0.0001,其影响比一般查询大 6 至 30 倍。对于所有 10 次运行,保留子集验证得出 Spearman rho = 1.00。当我们对 PAW 内容与对照内容的单独模型进行微调时,每个模型在其训练的文本类型上表现更好:PAW 训练的模型将动物福利文本的困惑度从 12.4 降低到 8.4,而对照训练的模型将对照文本的困惑度从 16.1 降低到 11.4。因此,小型、协调的维基百科编辑活动可以衡量语言模型如何处理这些编辑所涉及的主题。