论文

诊断微调 LLM 的泛化失败:钓鱼检测上的跨架构研究

Diagnosing Generalization Failures in Fine-Tuned LLMs: A Cross-Architectural Study on Phishing Detection

模型评测模型行为与机制分析

摘要

微调大语言模型(LLM)的实践已在专门任务上取得最先进性能,但诊断这些模型为何变得脆弱、无法泛化仍是一个关键的开放问题。为此,我们引入并应用一个多层诊断框架开展跨架构研究。我们在高风险的钓鱼检测任务上微调 Llama 3.1 8B、Gemma 2 9B 与 Mistral 模型,并使用 SHAP 分析与机制可解释性方法揭示其泛化失败的根因。我们的调查揭示三个关键发现:(1) 泛化由架构与数据多样性的强大协同驱动。Gemma 2 9B 模型取得最先进性能(>91% F1),但前提是在风格多样的“通才”数据集上训练。(2) 泛化高度依赖架构。我们诊断出 Llama 3.1 8B 的一个特定失败模式:它在窄域上表现良好,却无法整合多样数据,导致性能显著下滑。(3) 某些架构天生更具泛化性。Mistral 模型在多种训练范式下都被证明是稳定而坚韧的表现者。通过定位导致这些失败的有缺陷启发式,我们的工作提供了诊断与理解泛化失败的具体方法论,强调可靠的 AI 需要对架构、数据与训练策略之间相互作用的深入验证。

诊断微调 LLM 的泛化失败:钓鱼检测上的跨架构研究
图1:针对一封专业新闻通讯(professional newsletter)的假阴性预测所作的 SHAP 分析。蓝色 token 将预测推向 LEGIT,红色则将其推向 SPAM。颜色强度对应每个 token 影响的大小;为保持清晰,图中仅可视化影响最大的 token。影响较小的词以更浅的色调呈现,可能不可见。模型的输出分数显示在顶部;对于我们的二分类器,分数接近 1.0 表示预测为 SPAM,而较低的分数表示预测为 LEGIT。