论文

哪个印度在翻译中幸存下来? LLM 中印度口头传统的叙事同质化

Which India Survives Translation? Narrative Homogenisation Across Indian Oral Traditions in LLMs

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型 (LLM) 主要接受英语网络文本的训练,这些文本过度代表了某些文化叙事,引起了人们的担忧,即模型将非西方讲故事传统的多样性扁平化为单一的同质化原型。我们提出了一项试点计算研究,通过三个截然不同的印度地区口头和文学传统来检验这一点:拉贾斯坦帕布吉史诗、古典泰米尔桑格姆诗歌和孟加拉民间故事。我们收集了每个传统的真实参考语料库(分别为 11、21 和 10 段),并提示了两个 LLM(Claude Sonnet 和 Gemini),其中包含 54 代请求,涵盖每个传统的三种提示类型 - 通用、特定文化和区域语言。使用句子-BERT 嵌入和余弦相似度,我们测量参考漂移(输出相对于其他两个传统的真实文本的跟踪程度)和跨传统收敛(跨传统的输出相似程度)。我们发现,虽然输出仍然比其他传统更接近自己的传统参考,但相对于传统的真实距离所预测的,跨传统相似性很高(0.52-0.66),表明部分同质化。出乎意料的是,相对于英语提示,使用地方语言(印地语、泰米尔语或孟加拉语)提示始终会降低对正宗传统的忠实度,对于拉贾斯坦语和孟加拉语传统,降低幅度高达 27 个百分点。我们讨论了这一点,反对之前关于多语言提示的相互矛盾的结果,并认为它反映了引发普遍文化多样性和模拟一种狭隘的、记录较少的口头传统之间的差异。我们将该试点项目定位为对最近 LLM 生成的故事中印度文化歪曲的大规模人工注释研究的轻量级、可扩展的补充,作为更广泛的博士研究计划的一部分。