论文
诊断微调 LLM 的泛化失败:钓鱼检测上的跨架构研究
Diagnosing Generalization Failures in Fine-Tuned LLMs: A Cross-Architectural Study on Phishing Detection
摘要
微调大语言模型(LLM)的实践已在专门任务上取得最先进性能,但诊断这些模型为何变得脆弱、无法泛化仍是一个关键的开放问题。为此,我们引入并应用一个多层诊断框架开展跨架构研究。我们在高风险的钓鱼检测任务上微调 Llama 3.1 8B、Gemma 2 9B 与 Mistral 模型,并使用 SHAP 分析与机制可解释性方法揭示其泛化失败的根因。我们的调查揭示三个关键发现:(1) 泛化由架构与数据多样性的强大协同驱动。Gemma 2 9B 模型取得最先进性能(>91% F1),但前提是在风格多样的“通才”数据集上训练。(2) 泛化高度依赖架构。我们诊断出 Llama 3.1 8B 的一个特定失败模式:它在窄域上表现良好,却无法整合多样数据,导致性能显著下滑。(3) 某些架构天生更具泛化性。Mistral 模型在多种训练范式下都被证明是稳定而坚韧的表现者。通过定位导致这些失败的有缺陷启发式,我们的工作提供了诊断与理解泛化失败的具体方法论,强调可靠的 AI 需要对架构、数据与训练策略之间相互作用的深入验证。
