论文

小语言模型领域适应的可信成本:跨架构实证研究

Trustworthiness Costs of Domain Adaptation in Small Language Models:A Cross-Architecture Empirical Study

模型评测安全与风险评测

摘要

小语言模型 (SLM) 的领域适应已成为在资源有限、高风险环境(包括医疗保健、法律服务和财务分析)中部署功能强大的 NLP 系统的实用策略。虽然参数高效的 微调 的性能增益得到了很好的表征,但对可信度(事实校准和对抗鲁棒性)的相应影响仍然知之甚少。本文提出了第一个系统的跨领域、跨架构实证研究,量化了跨三个 SLM 架构(TinyLlama 1B、Gemma-2 2B、Llama 3.2 1B)、三个领域(医疗保健、法律、金融)、两种训练数据条件(良性和对抗性扰动)和四种 微调 策略(基线 LoRA、安全-DPO、黑暗经验回放和任务算术 LoRA、TA-LoRA)。可信度通过 TruthfulQA MC2(事实校准)和 HarmBench ASR(对抗稳健性)在所有 216 个实验配置(具有三个随机种子)中进行评估。出现了三个主要发现。首先,基线 QLoRA 域适应在所有模型域组合中产生最小的 TruthfulQA MC2 变化(平均值 |Delta TQA| < 0.02)。其次,受到对抗性干扰的训练数据持续提高领域适应质量(Delta 损失约为 -0.040),而不会恶化可信度基准。第三,三种安全保护策略都没有降低对抗伤害的敏感性:Safety-DPO 实际上是中性的(平均 Delta ASR < 0.001),而 Dark ER 和 TA-LoRA 在安全模型(Gemma-2 2B、Llama 3.2 1B)中分别使平均 HarmBench ASR 增加了 +0.171 和 +0.155,个别配置超过了 +0.45。这些结果挑战了基于重放和算术合并策略将对齐转移到域自适应 SLM 的假设。