论文
解开多语言 LLM 任务执行中的语言角色
Disentangling Language Roles in Multilingual LLM Task Execution
摘要
当指令、源内容和所需响应语言不一致时,多语言 LLM 的使用越来越多。现有的基准已经扩展了多语言指令跟踪评估,但它们很少在完全交叉的设计中隔离这三个角色。我们引入了 MTM-Bench,这是一种用于语言条件任务执行的受控基准,其中每个实例都由三元组 \((L_{\text{instr}}, L_{\text{content}}, L_{\text{resp}})\) 定义。在英语、西班牙语和中文中,MTM-Bench 枚举了所有 27 个三元组,并且每个模型在语义反转、最终状态提取和更新实现的语言纯度方面包含 2{,}430 个实例。我们使用语义正确性、目标语言遵守性、约束满意度、污染率和联合成功的分解指标来评估 20 个前沿和开放权重 LLM,并通过有针对性的人工审核验证评分。完全交叉的设计揭示了退化是根据语言在任务结构中所扮演的角色来组织的,而不仅仅是通过不匹配计数来组织的。响应语言角色是变异的主导轴,单个响应时隙不匹配是造成退化的主要原因。仅响应和完全不匹配的比较表明,不匹配计数并不是难度的单调预测因子,模型级别的排序因系统而异。任务族通过不同的渠道失败,这表明语义正确性本身并不能捕获可靠的多语言任务执行。