论文

Adversarial Arena:通过交互式竞赛进行众包式数据生成

Adversarial Arena: Crowdsourcing Data Generation through Interactive Competition

模型训练合成数据

摘要

大语言模型的后训练需要多样化、高质量的数据,而这些数据稀缺且获取成本高,在低资源领域和多轮对话场景中尤甚。常见的解决方案是众包或合成生成,但两者往往产生低质量或低多样性的数据。我们提出Adversarial Arena,通过把数据生成构造成对抗任务来构建高质量对话数据集:攻击者创造提示,防御者生成回应。多个团队之间的这种交互式竞赛自然产出多样且复杂的数据。我们通过与美国和欧洲顶尖高校的10个学术团队举办一场竞赛来验证这一方法,各团队分别构建攻击者或防御者机器人。这场聚焦网络安全领域LLM安全对齐的竞赛生成了19,683段多轮对话。在该数据集上微调一个开源模型,使其在CyberSecEval-Instruct上的安全代码生成提升18.47%,在CyberSecEval-MITRE上提升29.42%。

Adversarial Arena:通过交互式竞赛进行众包式数据生成:论文配图
图 1:对抗竞技场概述:攻击者/防御者对在几轮锦标赛中进行交互,每对在每一轮中都会生成多轮对话。这些对话在评估管道中被标记为成功/失败,从而生成攻击者和防御者的排名列表。排名列表和标记的对话在反馈循环中提供给攻击者和防御者,以提高生成数据的整体质量。