论文

大语言模型 中的跨语言响应一致性:基于 ILR 的六种语言对 Claude 的评估

Cross-Lingual Response Consistency in Large Language Models: An ILR-Informed Evaluation of Claude Across Six Languages

模型评测评测方法与指标

摘要

本文介绍了一个基于机构间语言圆桌会议 (ILR) 技能水平描述的系统评估框架,并将其应用于六种语言的克劳德 (Sonnet 4.6):英语、法语、罗马尼亚语、西班牙语、意大利语和德语。我们管理一组 12 个语义等效的提示簇,涵盖 ILR 复杂性级别 1 到 3+,收集 216 个响应(12 个提示、6 种语言、3 次运行),并通过将自动定量指标与专家 ILR 定性评估相结合的两层方法分析输出。定量分析表明,在相同提示下,法语的反应比德语的反应长约 30%,并且创意和情感集群显示出最高的跨语言表面差异。由具有 12 年 ILR/OPI 评估经验的六种语言专业人士进行的定性分析,确定了五种跨语言变异模式:语用消歧策略的系统差异、创意输出中的审美和文学传统差异、语言内部技术术语规范、文化校准差距(因缺乏有利于文化中和模板的特定文化内容而证明)以及情感支持反应中特定于语言的机构推荐行为。我们认为,应用于 LLM 输出的基于 ILR 的专家判断构成了一种新颖且未充分报告的评估方法,它补充了纯粹的计算基准,并且 Claude 中的跨语言输出变化是可解释的、依赖于领域的,并且对于公平的多语言人工智能部署而言是重要的。