论文
多语言幻觉基准:MultiWikiQHalluA
A multilingual hallucination benchmark: MultiWikiQHalluA
摘要
大多数幻觉评估都集中在英语上,因此尚不清楚研究结果是否会转移到资源匮乏的语言上。我们研究 忠实性 幻觉,定义为模型生成的内容流畅且可信,但与提供的输入不同或内部不一致。利用多语言 MultiWikiQA 数据集,我们利用 LettuceDetect 框架创建 306 种语言的合成幻觉数据集,并从中训练 30 种欧洲语言的 词元级 幻觉分类器。在这项工作中,我们对以下几种语言的模型幻觉进行了评估:英语、丹麦语、德语和冰岛语。使用这些分类器,我们评估了 Qwen3-0.6B、Qwen3-14B、Gemma-3-12B-IT、cogito-v1-preview-qwen-32B 和 cogito-v1-preview-llama-70B 的幻觉率。我们的分类器显示 Qwen3-0.6B 的幻觉率明显较高(高达 60% 的答案包含至少一种幻觉,在冰岛语中达到顶峰),而较大模型的幻觉率通常较低,其中 cogito-v1-preview-qwen-32B 和 cogito-v1-preview-llama-70B 在大多数语言上表现最佳。资源匮乏的语言(尤其是冰岛语)的幻觉率始终较高。