论文
团结中的智慧:多语言训练在谚语比喻语言识别中的作用
Wisdom in Unity: The Role of Multilingual Training in Figurative Language Identification in Proverbs
摘要
尽管比喻语言识别的多语言方法并不新鲜,但超越语言同质训练数据的转变需要更清楚地理解翻译的多语言监督的贡献。我们使用七种语言的 6,787 个翻译实例中的 742 个谚语概念来研究这个问题。我们通过逐步提高多语言监督水平来评估五种模型,包括多语言编码器和指令调整的 LLM。此外,我们引入了谚语的多维注释框架,通过四种互补的比喻形式来表征谚语:隐喻、道德/咨询、因果和特定文化。我们的研究结果表明,总体而言,添加超过 50% 的多语言训练数据只能提供有限的额外改进,尽管最佳监督水平因模型和语言而异。此外,我们还表明,结合不同的比喻形式可以产生最强的整体表现。一个值得注意的发现是,在多语言监督下,最不常见的特定文化的比喻形式表现出最大的性能提升。此外,谚语的道德/咨询和特定文化形式更有助于指导调整 LLM 整体比喻识别性能。这些发现促使多语言比喻识别超越以隐喻为中心的分类法,转向概念层面的多维框架,该框架明确地模拟了上下文代表的比喻意义的互补形式。