论文

评估狭窄微调引发涌现错位的领域层面易感性

Assessing Domain-Level Susceptibility to Emergent Misalignment from Narrow Finetuning

模型评测安全与风险评测

摘要

随着语言模型日益被用于自主任务,涌现错位(emergent misalignment)对AI安全构成风险。本文提出一组在横跨11个多样领域的不安全数据集上微调的大语言模型(LLM)总体,并在带与不带后门触发器的条件下,用一组无关用户提示对它们进行评估。在Qwen2.5-Coder-7B-Instruct与GPT-4o-mini上的评估实验揭示两个关键发现:(i)后门触发器在77.8%的领域中提高错位率(平均下降4.33分),其中risky-financial-advice与toxic-legal-advice效应最大;(ii)领域脆弱性差异巨大:从不正确数学(incorrect-math)微调的0%错位,到gore-movie-trivia微调的87.67%。在进一步的实验中,我们探索多个研究问题,发现成员推断指标——尤其当针对非指令微调的基模型调整后——可作为预测可能出现的广泛错位程度的良好先验。此外,我们探测在不同数据集上微调的模型之间的错位,并分析在一个涌现错位(EM)模型上提取的方向能否泛化以引导其他模型的行为。据我们所知,本工作还首次提供按领域的涌现错位分类排名,对AI安全与后训练具有启示意义。本工作还标准化了构建错位数据集的配方。所有代码与数据集均在GitHub公开。

评估狭窄微调引发涌现错位的领域层面易感性
图7:7.5B 模型按领域类别划分的多样性指标(Vendi Score 与 Semantic Diversity),按(Pasarkar and Dieng, 2024)中所述进行系统量化。Ambiguous 领域显示最高多样性,其次是 Critical 领域,Non-Critical 领域多样性最低。