论文
IndicGuard:印度语言的多语言安全防护模型和数据集
IndicGuard: A Multilingual Safety Guard Model and Dataset for Indic Languages
摘要
随着 大语言模型 (LLM) 在不同语言环境中实现广泛整合,确保其安全性以及与区域规范价值观的一致性仍然是一个严峻的挑战。当前的安全机制主要针对以英语为中心的框架进行了优化,往往无法捕捉印度地区固有的独特社会文化敏感性和局部伤害类别。为了解决这一差距,我们引入了 IndicGuard,这是一种印度语言的多语言安全防护模型和数据集。我们构建了一个包含十种主要印度语言的大量、文化上细致入微的安全数据集,经过系统策划,以捕获区域危害、敏感的社会政治背景和对抗性越狱。利用该语料库,我们微调了基于 Gemma-3-4B-IT 的 4B 参数指令调整模型,作为实时内容审核和策略合规性检查的多语言安全护栏。我们的实证评估表明,IndicGuard 显着增强了 LLM 针对局部漏洞的鲁棒性,在不同的对话轮次中实现了高度的审核一致性。至关重要的是,在评估的语言中,IndicGuard 始终优于现有基准模型 CultureGuard。最后,我们证明我们的模型可以有效地推广到训练中排除的低资源印度语言,证实了该框架的结构稳健性和跨语言迁移能力。