论文

BanglaVeilGuard:Bangla 大语言模型 的跨脚本安全基准测试和轻量级护栏

BanglaVeilGuard: Cross-Script Safety Benchmarking and Lightweight Guardrails for Bangla Large Language Models

AI 基础设施AI安全与内容治理基础设施

摘要

孟加拉语 大语言模型 (LLM) 的安全性很难用以英语为中心的或标准脚本基准进行评估,因为孟加拉语用户通常会跨脚本、拼写、代码混合形式和区域寄存器进行书写。本文介绍了 BanglaVeilGuard,这是一种紧凑的孟加拉优先安全基准和轻量级提示防护,适用于六种语言形式:标准孟加拉语、罗马化孟加拉语、孟加拉语、代码混合孟加拉语-英语、嘈杂孟加拉语和方言孟加拉语。该基准测试包含 2,366 个经过质量过滤的提示和一个保留的 354 个提示评估拆分,涵盖不安全、安全和安全敏感请求。 BanglaVeilGuard 使用带有提示风险分类器和阈值预生成门的非破坏性多视图标准化,使其能够在不改变权重的情况下筛选异构目标模型的提示。在目标模型系列中,Claude Opus 4.8、BanglaLLama 和 TituLLM 的确定性响应评分下,防护运行将攻击成功率从 93.8--100.0\% 降低到 6.3\%;配备 BanglaVeilGuard 的 TigerLLM-1B 准确率达到 78.2%,ASR 为 8.8%。提示防护还达到了 88.5% 的不安全召回率,大大高于评估的仅提示防护基线。剩下的主要成本是过度拒绝方言和嘈杂的良性提示,这揭示了 Bangla LLM 部署的具体安全帮助边界。