论文

自消费操演循环中大语言模型偏差的观察与补救

Observations and Remedies for Large Language Model Bias in Self-Consuming Performative Loop

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型(LLM)的快速发展引发了使用合成数据训练未来模型的浓厚兴趣。然而,这会造成一种自消费再训练循环:模型在自己的输出上训练,可能导致性能下降并诱发新偏差。在真实应用中,先前部署的 LLM 可能影响其生成的数据,形成一个由用户反馈驱动的动态系统。例如,如果一个模型持续无法很好地服务某一群体的用户,从这一特定用户群体收集到的查询数据就会减少。在本研究中,我们提出自消费操演循环(Self-Consuming Performative Loop,SCPL)的概念,并在受控操演反馈下研究合成数据在这些动态迭代训练过程中对偏差演化的作用。这一受控设定的动因是难以获取来自动态生产系统的真实用户偏好数据,它使我们能够以有原则的方式隔离并分析反馈驱动的偏差演化。我们关注两类循环,包括典型的再训练设定和很大程度上未被充分研究的增量微调设定。通过在三个真实任务上的实验,我们发现操演循环会加剧偏好偏差并降低差异偏差。我们设计了基于奖励的拒绝采样策略来缓解偏差,朝着更可信的自我改进系统迈进。

自消费操演循环中大语言模型偏差的观察与补救 配图
图 6:使用 Qwen2.5-1.5B 时,不同缓解方法在两个任务上的性能。