论文
技能问题:LLM 中的技能是否具有语言不变性?
Skill Issue: Are Skills Language-Invariant in LLMs?
摘要
大语言模型 跨语言获取知识的方式不一致,但在与不同语言交互时,他们的技能有多大差异?这项工作根据知识和一般基准表现正交地量化跨语言技能的不一致。我们通过多语言自我对弈来做到这一点:同一模型的两个实例在基于文本的游戏中竞争,每个实例通过不同的语言界面进行交互。由于模型、对手、规则、状态空间和可用操作保持固定,因此此设置隔离了语言对模型实现行为的影响。我们构建了 TextArena 的多语言扩展,并评估了跨八种语言和六种游戏的三个开放权重模型,涵盖空间推理、不完美信息、资源分配和重复交互。我们发现,同一模型在不同语言中表现出明显不同的游戏强度,输赢幅度、无效行动和战略倾向都有系统的变化。详细分析揭示了空间推理、卡条件决策和最佳走法选择中特定于语言的失败。在某些设置中,仅更改中间推理语言即可恢复大部分损失的性能,这表明语言可以影响决策过程的不同阶段。这些结果表明,技能差异是开发真正的多语言模型的一个可衡量的主要障碍。更好地理解这些差异可以帮助我们设计跨语言表现更公平的模型。