论文
Adversarial Arena:通过交互式竞赛进行众包式数据生成
Adversarial Arena: Crowdsourcing Data Generation through Interactive Competition
摘要
大语言模型的后训练需要多样化、高质量的数据,而这些数据稀缺且获取成本高,在低资源领域和多轮对话场景中尤甚。常见的解决方案是众包或合成生成,但两者往往产生低质量或低多样性的数据。我们提出Adversarial Arena,通过把数据生成构造成对抗任务来构建高质量对话数据集:攻击者创造提示,防御者生成回应。多个团队之间的这种交互式竞赛自然产出多样且复杂的数据。我们通过与美国和欧洲顶尖高校的10个学术团队举办一场竞赛来验证这一方法,各团队分别构建攻击者或防御者机器人。这场聚焦网络安全领域LLM安全对齐的竞赛生成了19,683段多轮对话。在该数据集上微调一个开源模型,使其在CyberSecEval-Instruct上的安全代码生成提升18.47%,在CyberSecEval-MITRE上提升29.42%。
