论文

当意义不是字面意义时:探索跨语言和形式的惯用意义

When Meaning Isn't Literal: Exploring Idiomatic Meaning Across Languages and Modalities

模型评测基准与评测资源

摘要

惯用推理与隐喻和文化紧密交织在一起,仍然是当代语言模型的盲点,其进展偏向于表面词汇和语义线索。例如,孟加拉语习语 \textit{\foreignlanguage{bengali}{\char"0986\char"0999\char"09CD\char"0997\char"09C1 \char"09B0 \char"09AB\char"09B2 \char"099F\char"0995}} (angur fol tok,“葡萄是酸的”):它编码否认驱动的合理化,但幼稚的模型却抓住了字面上的狐狸和葡萄的意象。为了解决这一疏忽,我们推出了“Mediom”,这是一个包含 3,533 个印地语、孟加拉语和泰语习语的多语言、多模态习语语料库,每个习语都配有人工参考解释、跨语言翻译和精心对齐的文本图像表示。我们在 Mediom 上对 大语言模型(文本推理)和视觉语言模型(比喻消歧)进行基准测试,揭示了隐喻理解中的系统性失败。为了弥补这些差距,我们提出了“HIDE”,这是一个基于提示的习语解释框架,它利用错误反馈检索和有针对性的诊断线索来进行迭代推理细化。 Mediom 和 HIDE 共同建立了严格的测试平台和方法,用于基于文化的多模式习语理解,并在下一代人工智能系统中嵌入推理提示。