论文
LLM中的形象和文化知识:通过微调研究跨域转移
Figurative and Cultural Knowledge in LLMs: Investigating Cross-Domain Transfer through Fine-Tuning
摘要
比喻语言深深地植根于文化之中;流利的使用不仅需要语言能力,还需要文化沉浸。我们问LLM是否可以学习这个链接:文化数据上的微调是否可以提高比喻语言的理解,反之亦然?我们对四个模型(ALLaM-7B、Fanar-1-9B、Qwen3-8B、Llama-3.1-8B)和六个阿拉伯数据集进行了系统研究,涵盖不同方言和地区的文化常识、谚语和诗歌。诗歌上的 微调 提高了习语理解(+2.33%,p<0.05),这是我们的阿拉伯MMLU控制无法重现的增益,表明它源于比喻内容而不是阿拉伯语言适应,并指出对跨比喻类型转移的非字面含义的敏感性。相比之下,文化 微调 降低了两个以阿拉伯语为中心的模型中谚语解释的准确性。否则,两个领域之间的迁移与噪声无法区分,阿拉伯语模型在 微调 之后频繁回归,表明相关知识先前已饱和,而多语言模型则显示出更大的适应空间。错误分析进一步表明,微调 强化了经验文化知识,同时破坏了历史事实知识的稳定性。我们的研究结果表明,文化与比喻语言之间的关系虽然在概念上是自然的,但仅通过 微调 并不能直接捕捉到。