论文
MIPIAD:使用 Qwen 进行多语言间接提示注入攻击防御 -- TF-IDF 混合和元集成学习
MIPIAD: Multilingual Indirect Prompt Injection Attack Defense with Qwen -- TF-IDF Hybrid and Meta-Ensemble Learning
摘要
间接提示注入仍然是检索增强和使用工具的 LLM 系统中的一个持续弱点,并且在多语言环境中该问题变得更难以表征。我们提出了 MIPIAD,这是一个针对英语和孟加拉语进行评估的防御框架,它结合了通过 LoRA (XLPID) 从 Qwen2.5-1.5B 微调的序列分类器、TF-IDF 词汇特征以及通过后期融合、堆叠和梯度提升进行验证调整的集成。该框架根据 BIPIA(Yi 等人,2023)模板构建的综合基准进行评估,该模板涵盖五个任务系列——电子邮件、表格、QA、摘要和代码,包含超过 143 万个生成的样本,并使用互斥的攻击类别进行训练和测试分割。在整个实验中,词汇信号证明很强(TF-IDF+SVM F1=0.77),并且混合 XLPID+TF-IDF 集成实现了最好的整体 F1(0.9205),而 Boosting Ensemble 实现了最好的 AUROC(0.9378)。相对于独立的神经模型,集成方法一致地减少了英语-孟加拉语跨语言差距。该管道专为可扩展性而设计:NLLB-200 支持 200 多种语言,XLPID 的多语言主干可以重新定位到其他语言,而无需更改架构;实证验证目前仅限于英语和孟加拉语