论文

表面上礼貌,实际上却被打破:用于修复资源匮乏的孟加拉文本生成中的生成和注册失败的精选数据集

Polite on the Surface, Broken in Practice: A Curated Dataset for Fixing Generation and Register Failures in Low-Resource Bangla Text Generation

模型评测基准与评测资源

摘要

多语言 大语言模型 (MLLM) 的最新进展显着增强了跨语言对话能力,但对文化细微差别和上下文相关的通信进行建模仍然是一个关键瓶颈。具体来说,现有的最先进模型在处理孟加拉语等资源匮乏环境中的结构变化、地区习语和敬语一致性时表现出严重的务实差距。为了解决这一限制,我们为 \textbf{BangLa 应用程序和 DialoguE 生成 - BLADE} 引入了一种新颖的、文化上一致的指令调整数据集和基准测试框架,其中包含 4,196 美元精心策划的交互对。我们利用此资源系统地微调和评估领先的开放权重架构,包括 DeepSeek-8B 和 LLaMA-3.2-3B,通过 4 位 NormalFloat (NF4) 量化框架中的 LoRA 适配器利用参数高效的 微调。我们的实证评估表明,在我们的数据集上微调的模型在结构保真度和敬语对齐方面产生了显着的改进,为弥合低资源多语言文本生成中的语用差异提供了严格的基准。代码和数据集:https://github.com/ashuvo25/Bangla_Application_LLM/tree/main