论文

谁给开斋节带来了复活节彩蛋?审核不同语言和地区的数学应用题的文化翻译

Who Brought Easter Eggs to Eid? Auditing Cultural Translation of Math Word Problems Across Diverse Languages and Regions

模型评测模型行为与机制分析

摘要

大语言模型 越来越多地用于调整数学应用题以实现大规模的个性化学习,但这些调整是否在模型之间保持一致、大规模地保留文化多样性以及揭示哪些文化实体模型认为最重要,仍然是一个悬而未决的问题。我们分析了 Claude Opus 4、GPT-4.1 和 Gemini 2.5 Pro 如何将 60 个英语数学应用题改编成孟加拉语、印地语、旁遮普语(印度)、乌尔都语、信德语(巴基斯坦)、意大利语和西西里语(意大利),这是一个涵盖完整资源范围的语言集,从资源丰富的意大利语和印地语到研究不足的信德语、西西里语和旁遮普语。我们注释了 6,489 个实体转换,对模型是否保留、本地化、概括、省略或更改实体(例如名称、食物和地点)进行编码。模型在 62.5% 的案例中同意转型类型,只有 33.5% 的模型在特定替代上达成一致,这意味着模型的选择直接决定了学生所遇到的文化世界。所有 21 种语言模型组合都显示出熵崩溃,适应压缩而不是扩大文化多样性。模型优先考虑名称、食物和货币等表面标记,同时保留更深层次的结构特征,例如嵌入特定文化假设的年级系统。尽管提示指定了目标国家,但模型通过将孟加拉语塔卡用于印度孟加拉语学生来错误地分配区域背景,并产生跨文化污染,例如将寻找彩蛋作为开斋节活动。在个别翻译中可以看到一些失败。其他问题,包括多样性崩溃、对表面标记的系统偏好以及一致的区域错误归因,只有通过语料库级别的分析才能出现。使适应的问题看起来正确的表面合理性恰恰使更深层次的故障容易被忽视。