论文
CHARM:多元文化角色扮演基准的角色幻觉
CHARM: Character Hallucination for Multicultural Role Play Benchmark
摘要
角色扮演 大语言模型 (LLM) 应采用角色的风格,同时尊重该角色的知识边界。先前的评估检测角色幻觉,但很少区分错误是否是由于未能识别边界或尽管识别但未能遵守而引起的。我们引入了 CHARM,这是一个多元文化基准,由来自五个文化语言区域的 40 个真实和虚构的角色组成,并经过本地评论家的验证。它使用支持弃权的多项选择题来探讨两种边界类型:时间(历史与现代)和跨宇宙(角色叙述或历史宇宙之外的实体)。我们提出了一个两阶段的评估,将边界意识(明确识别查询超出范围)与边界合规性(回答具体问题时弃权)分开。对六个 LLM 的评估表明,幻觉主要是由合规性失败引起的。模型经常承认某个问题超出了角色的知识范围,但仍然提供真实的、不符合角色的答案。通过向目标角色重新提出相同的问题,我们确认这些案例中的很大一部分都是经过验证的参数覆盖;该模型存储了相关事实,但未能抑制它。我们还观察到这些失败中的系统性文化差异,这与模型知识中不同地区的人物表示方式的不平衡相一致。