论文

合成数据中的隐藏威胁:通过良性文本进行隐蔽的定向偏差注入

Hidden Threat in Synthetic Data: Covert Targeted Bias Injection through Benign Text

模型评测安全与风险评测

摘要

合成数据越来越多地用于训练 大语言模型 (LLM),但其安全隐患仍然知之甚少。先前关于潜意识学习的研究表明,模型可以从看似不相关的训练数据中继承行为特征。在这项工作中,我们研究是否可以利用这种机制通过语义良性的合成数据将有针对性的社会偏见注入到对齐的模型中。我们构建了一个管道,其中未对齐的教师模型在创意写作和代码生成等领域生成经过过滤的合成数据集,然后将其用于微调对齐的学生模型。我们的实验表明,看起来良性的合成数据可以充当传输目标偏差的隐蔽渠道,同时在很大程度上保留学生模型的一般任务能力。这些结果揭示了合成数据驱动的 LLM 训练管道中先前未充分探索的安全风险,并强调需要改进保障措施。作为实现这一目标的一个可能的步骤,我们建议基于对数线性的评分可以为筛选看似良性的合成数据提供有用的信号。