论文
LKValues:使 大语言模型 与斯里兰卡社会价值观保持一致
LKValues: Aligning Large Language Models with Sri Lankan Societal Values
摘要
大语言模型 (LLM) 的价值取向已被证明在文化上偏向西方规范。这导致斯里兰卡等具有独特文化动力的多语言社会对当地价值观的处理不当。现有基准忽视了斯里兰卡官方语言僧伽罗语中的价值观,阻碍了文化敏感评估和 微调。为了弥补这一差距,我们提出了 LKValues,这是第一个以调查为基础的斯里兰卡价值调整资源套件。通过对 205 名受访者进行的三语调查,将适应的全球框架与 LLM 引发的本地结构相结合,我们得出了 40 种得到大多数人认可的社会价值观。使用这些值,我们构建了 LKvaluesIT(一个包含 15 万个基于场景的实例的僧伽罗语英语新闻衍生指令语料库)和 LKvaluesBench(一个包含 1,000 个实例的值敏感评估基准)。我们使用 LKvaluesBench 评估一组专有且开放权重的 LLM。我们微调了三个开放重量基础模型(Qwen3.5-4B-Base、Qwen3.5-9B-Base 和 Aya-Expanse-8B-Base)。我们的实验表明,更新和更大的 LLM 仍然表现出低资源和文化价值一致性差距。 LKValues 微调 改进了英语和僧伽罗语的 Qwen 系列模型,减少了无效输出和跨语言差异,但增益仍然依赖于模型系列。这些突出了 LKValues 在嵌入斯里兰卡价值观方面的功效,为资源匮乏、特定国家的多元化价值观调整提供了可复制的渠道。该数据集可在 https://github.com/NextME14/LKValues 上公开获取。