论文
Pak3H:使用人类语境乌尔都语基准评估 LLM 对齐中文化不匹配的成本
Pak3H: Evaluating the Cost of Cultural Mismatch in LLM Alignment with a Human-Contextualized Urdu Benchmark
摘要
大语言模型 (LLM) 在以英语为中心的环境中表现出强大的乐于助人、无害和诚实 (3H) 一致性,但由于文化不匹配,这些成果很难转移到资源匮乏的语言。现有的多语言 3H 基准主要依赖于自动翻译或基于 LLM 的合成,传播源语言偏差,同时牺牲本地相关性。为了解决这一差距,我们引入了 Pak3H1,这是第一个经过人类验证、文化背景化的乌尔都语基准套件,用于 3H 对齐,包括 PakAlpaca(乐于助人)、PakBeaverTails(无害)和 PakTruthfulQA(诚实)。我们的多阶段流程集成了手动文化适应和字典引导的后期编辑,以优先考虑母语人士的判断,确保语义保真度和上下文真实性。跨多个开放和专有 LLM 架构的零样本评估揭示了系统性的跨语言对齐差距:本地化背景下的帮助获胜率下降,针对区域安全风险的无害护栏崩溃,以及由于本地化事实限制,综合诚实指标大幅下降。这些发现暴露了当前对齐方法的结构局限性,强调了人工引导本地化以实现公平的多语言评估的必要性。