论文

BenHalluEval:孟加拉语 大语言模型 的多任务幻觉评估框架

BenHalluEval: A Multi-Task Hallucination Evaluation Framework for Large Language Models on Bengali

模型评测基准与评测资源

摘要

尽管孟加拉语是世界上第六大语言,但之前没有任何工作系统地评估 大语言模型 (LLM) 中孟加拉语的幻觉。我们介绍 BenHalluEval,这是一个针对孟加拉语的细粒度幻觉评估框架,涵盖四个任务:生成问答(GQA)、孟加拉英语代码混合 QA、总结和推理。我们使用 GPT-5.4 构建了来自三个现有孟加拉语数据集的 12,000 名幻觉候选者,涉及 12 种特定于任务的幻觉类型,并在双轨协议下评估了涵盖面向推理、多语言和以孟加拉语为中心的类别的 7 个 LLM,该双轨协议独立测量 真值 实例的误报率(轨道 A)和幻觉候选者的幻觉检测率(轨道 B)。为了共同惩罚这两种故障模式并防止因统一响应偏差而导致分数过高,我们提出了 BenHalluScore,这是一种双轨校准指标,其跨模型和任务的范围从 7.72% 到 55.42%,揭示了幻觉校准的巨大差异。作为缓解策略应用的思维链提示改变了反应分布,但没有持续改善幻觉辨别力。 BenHalluEval 为孟加拉语建立了第一个专门的幻觉基准,并强调了单轨和仅提示评估方法对于资源匮乏的语言环境的不足。数据集和代码可在 https://anonymous.4open.science/r/BanglaHalluEval-EB77 获取。