论文
高、中、低资源语言的句子和对话中的多语言习语
Multilingual Idioms in Sentences and Conversations Across High-, Medium-, and Low-Resource Languages
摘要
惯用表达对多语言 NLP 提出了重大挑战,因为它们的含义在比喻和字面用法之间转换,通常需要上下文才能准确解释。之前的工作主要集中在高资源语言上,通常会评估孤立的习语含义问题,而忽略了现实的话语。我们介绍 MIDI,这是一个由母语人士管理的多语言习语数据集,涵盖 3 种高级语言、3 种中级语言和 12 种低资源语言。与以前的数据集不同,MIDI 提供嵌入句子级和会话上下文中的习语,捕获字面和比喻读数。对最先进模型的基准测试表明,低资源语言中的习语理解能力会下降,并且在所有资源层中,字面解释比比喻解释要困难得多。对话上下文可以提高性能,但并不能消除这些差异。通过对隐藏表征的受控测试和干预,我们进一步将记忆与推理分开,暴露出当前模型的核心局限性。