论文
VIVID:揭示越南语 NLP 中比喻语言差距的文化基准
VIVID: A Culturally Grounded Benchmark Exposing the Figurative Language Gap in Vietnamese NLP
摘要
我们推出了 VIVID(用于验证和解释深度的越南习语),这是第一个用于评估越南语基于文化的比喻语言理解的系统基准。 VIVID 包含 1,636 个成语和谚语,注释有五种复杂特征(字面表达、语用细微差别、汉越术语、生僻词汇、民间知识)和七个语义主题。我们建立了一个结合生成性任务和判别性任务的评估框架,提出了一种 LLM-as-a-Judge 方法,该方法具有基于方面的提示,并针对人类判断进行了验证(Cohen 的 kappa = 0.792)。评估八个最先进的模型揭示了关键的差距:越南语专用模型的表现远远低于多语言系统(VinaLLaMA-7B:0.13 vs. GPT-4o:2.46),甚至顶级模型的得分也不到最高分数的 50%。值得注意的是,小样本提示并不能普遍提高性能,GPT-4o 由于风格过度拟合而表现出性能下降。我们的分析暴露了系统性失败,包括字面过度解释、词汇差距和语用扁平化,表明当前模型缺乏细致入微的比喻解释的文化能力。 VIVID 提供了在文化丰富的背景下促进比喻语言理解的重要工具。