论文

被认可但未被产生:特定文化的亲属称谓的一代基准

Recognized but Not Produced: A Generation Benchmark for Culturally Specific Kinship Terms

模型评测基准与评测资源

摘要

当前文献使用多项选择基准评估多语言亲属关系理解的大型语言模型(LLM),将其视为识别问题。相反,我们提示五名开放权重大语言模型在两项交际任务中以三种非西方语言(印地语、泰米尔语和韩语)生成亲属关系术语,并将其与匹配的选项支持的选择基线配对。在相同的关系语言单元上,GPT OSS120B 在 75 个有效单元中的 90.67% 中选择了正确的术语,但在相应尝试的 36.00% 中生成了可接受的术语; Llama 3.370B 显示了相同的模式(77.92% 对比 24.24%)。由于四选项条件显示候选术语并且不需要生成脚本,因此差异被解释为评估格式差距,而不是词汇知识完整的直接证明。在明确指定的 L3 提示上,准确度差异很大,从 GLM-5.1 的 72.29% 到 Llama-3.370B 的 24.24%。父系血统优势是特定于语言的;它在印地语中很大,但在韩语中较弱或相反,而泰米尔语共享术语对提供了对测量变化的控制。这些结果表明,即使明确说明了这种关系,文化上特定的亲属关系的产生仍然很困难,并激发了基于代的评估和多项选择测试。