论文
MORPHOGEN:评估性别意识形态生成的多语言基准
MORPHOGEN: A Multilingual Benchmark for Evaluating Gender-Aware Morphological Generation
摘要
虽然多语言 大语言模型 (LLM) 在翻译和问答等高级任务上表现良好,但它们处理语法性别和形态一致性的能力仍未得到充分探索。在形态丰富的语言中,性别会影响动词变位、代词,甚至影响第一人称结构,明确或隐含地提及性别。我们引入了 MORPHOGEN,一个基于形态学的大规模基准数据集,用于评估三种类型不同的语法性别语言(法语、阿拉伯语和印地语)的性别意识生成。核心任务 GENFORM 要求模型以相反的性别重写第一人称句子,同时保留其含义和结构。我们构建了一个涵盖这三种语言的高质量综合数据集,并对 15 种流行的多语言 LLM (2B-70B) 执行此转换的能力进行了基准测试。我们的结果揭示了当前模型如何处理形态性别的显着差距和有趣的见解。 MORPHOGEN 为性别意识语言建模提供了一个聚焦的诊断镜头,并为未来包容性和形态敏感的 NLP 研究奠定了基础。